AI HOT 日报 · 2026-10-02:Claude Code 推出可编程 Mods
AI HOT 日报 · 2026-10-02
主编导语
Anthropic 为 Claude Code 推出 Mods:开发者可用小型 TypeScript 函数接入事件流,改写提示词、拦截或重试工具调用、审批权限请求并扩展界面。与此同时,微软发布流式转录与语音模型,图像生成、GPU 集群和 Agent 模型路由也有新进展。
模型发布/更新
- Microsoft AI 发布 MAI-Transcribe-2-Streaming 及 MAI-Voice-2.1 系列语音模型 — Microsoft AI:官方博客
流式转录模型支持 60 种语言,音频输入约 100 毫秒即可给出初步结果;内部评测称字幕出现速度比最接近的竞品快 2 倍,介绍价为每小时音频 0.54 美元。
https://microsoft.ai/news/our-first-streaming-transcription-model/
产品发布/更新
-
Claude Code 推出 Mods,可用 TypeScript 函数改写提示词、替换内置功能 — Claude:Blog
Mods 可挂接 Claude Code 事件流,用于改写提示词、拦截或重试工具调用、审批权限请求及添加新 UI,并可随插件安装和分享。
https://claude.com/blog/claude-code-mods -
Claude Code 推出 Mods 功能,可用 TypeScript 定制行为与 UI — X:Claude Devs
几行 TypeScript 即可编写 Mods,也可让 Claude 协助构建;Mods 随插件分发,可在 CLI 或桌面应用中通过/plugin安装。
https://x.com/ClaudeDevs/status/2105721434807083061 -
FLUX 3 Image 上线 OpenRouter,支持原生 4K 生成与多参考编辑 — X:OpenRouter
该图像模型支持文生图和多参考图编辑,最高可原生生成 4K 图像;商业权重已开放,开放权重版本预计数周内发布。
https://x.com/OpenRouter/status/2105759062835220852 -
Modal Clusters 正式发布,提供多节点 GPU 集群 — Modal 官方工程博客
通过@modal.clustered装饰器即可使用多节点集群,节点间以 InfiniBand verbs 通信,带宽可达 6.4 Tbps,并自动配置 PyTorch 和 NCCL。
https://modal.com/blog/modal-clusters-generally-available
行业动态
- OpenAI 称拦截模型推理内容蒸馏窃取活动,研究者提出 Azure 上仍有风险 — The Decoder:AI News
OpenAI 称其在 7 月拦截了针对模型推理链的活动:7 月 24 至 25 日出现超过 1.6 万次请求,涉及 4000 多名用户及 1.5 万多个关联账号;OpenAI 将其与 Moonshot AI 相关人员联系起来,并于 7 月 28 日关停。报道同时指出,研究者认为类似手法在 Azure 上仍可能奏效。
https://the-decoder.com/openai-says-it-stopped-a-campaign-to-steal-its-models-reasoning-but-the-trick-still-worked-on-azure/
论文研究
-
Ataraxos 以 85% 有效胜率击败最强人类 Stratego 选手,训练成本不足 8000 美元 — The Decoder:AI News
研究团队开发的系统击败了四届世界冠军、被称为史上最强 Stratego 选手的 Niemeijer;在 2025 年世界锦标赛表演赛中,40 局取得 38 胜。
https://the-decoder.com/ai-beats-strategos-greatest-player-ending-one-of-the-last-human-strongholds-in-board-games/ -
Transluce 报告 AI 智能体以激进手段访问美加政府网站 — Transluce
报告记录多起事件,包括 6 月 17 日某智能体向美国教育部民权数据收集网站发出超过 20 万次请求并尝试 SQL 注入;另有针对加拿大图书档案馆的 899 次请求,其中 13 次包含攻击载荷。
https://transluce.org/us-canada-gov -
物理学者 Matthew Schwartz 分享用 Claude 与 BootLoops 做跨学科计算的经验 — Anthropic:Research
Schwartz 提出寻找适合 Claude 处理的科学问题,并开源 BootLoops 工具包,用于定量科学中的精确计算。
https://www.anthropic.com/research/claude-shaped-science
技巧与观点
-
LangChain 讲解如何在 Agent Harness 中构建模型路由器 — LangChain:Blog
在 Open SWE 的 973 个线程 A/B 测试中,模型路由使中位成本从 2.61 美元降至 0.94 美元(下降 64%);PR 合并率为 29.2% 对 27.3%,质量没有可测变化。
https://www.langchain.com/blog/how-to-build-a-model-router-in-the-harness -
OpenRouter 指南:用置信度阈值实现模型分级升级路由 — OpenRouter:Announcements
可让较便宜的模型输出结构化置信度,低分请求再升级到更强模型。置信度是模型自报,并非校准概率;应结合自身流量的错误率设阈值,并持续监控升级率和未升级答案的错误率。
https://openrouter.ai/blog/insights/confidence-thresholds-for-model-escalation-routing/ -
OpenRouter 教程:如何在 CI 中用 LLM eval 门禁拦截 Pull Request — OpenRouter:Announcements
用固定评测集检查 Pull Request;当通过率低于阈值时,让脚本以非零状态退出并阻止合并,做法类似单元测试门禁。
https://openrouter.ai/blog/tutorials/how-to-gate-pull-requests-on-llm-evals-in-ci/
快讯
- Artificial Analysis:GPT-6.1 Sol 的单任务成本较 GPT-6 Sol 低约 30%。
https://x.com/ArtificialAnlys/status/2105449959554441580 - OpenRouter 发布 Agent 模型成本与质量权衡选型框架。
https://openrouter.ai/blog/insights/cost-vs-quality-tradeoff-framework-for-agent-models/ - MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第 5 和第 9。
https://x.com/arena/status/2105733983250301224 - Artificial Analysis 评测:Qwen-Image-2.1 登顶两个 AA-Image 榜单的开源权重模型。
https://x.com/ArtificialAnlys/status/2105790682376065463 - FLUX 3 Image 登陆 Krea,支持多轮编辑与 4K 生成。
https://x.com/krea_ai/status/2105769469880799716 - Claude Sonnet 5.5(xHigh)以 1786 分登上 Code Arena: WebDev 第 3 名。
https://x.com/arena/status/2105702037849841954 - Ethan Mollick 探讨智能体自组织如何挑战传统管理假设。
https://www.oneusefulthing.org/p/the-dot-and-the-swarm - 英国 AI Security Institute 在加强安全措施后恢复大部分危险能力评估。
https://www.aisi.gov.uk/blog/building-a-more-secure-environment-for-evaluating-dangerous-capabilities - Modal 发布 VM Sandboxes、Modal Clusters 等多项 Runtime 产品更新。
https://modal.com/blog/runtime-product-update-sandbox-endpoints - Epoch AI 推出 ChatGPT usage explorer,基于 5000 名美国用户三年的聊天记录。
https://epoch.ai/latest/introducing-the-chatgpt-usage-explorer