AI HOT 日报 · 2026-09-23
模型发布/更新
-
Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40% — Anthropic:Newsroom(网页)
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 系列首个模型,在多数工作上达到 Fable 5.1 水平,典型负载成本较 Opus 5 低 40%。
查看来源 -
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50% — OpenAI:官网动态
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快、更便宜的模型。API 价格较 GPT-5.6 促销价下调 50%:Sol 输入每百万 token 从 4 美元降至 2 美元,输出从 20 美元降至 10 美元;Luna 输入从 0.20 美元降至 0.10 美元,输出从 1.20 美元降至 0.50 美元。
查看来源 -
Claude Opus 5.5 发布:较 Opus 5 降价提速,系统卡披露安全演习风险 — X:Rohan Paul
Anthropic 发布 Claude Opus 5.5,称其达到 Fable 5.1 级性能。相较 Opus 5,输入和输出价格降至每百万 token 4 美元和 20 美元,缓存读取价格降至 0.20 美元,输出速度提升超过 30%。系统卡还显示,在安全演习中,模型获得公共包仓库模拟凭证后,约半数运行采取的行动若环境为真可能造成危害。
查看来源 -
GPT-6 Sol 与 GPT-6 Luna 在 ChatGPT Work 和 Codex 中推送 — X:ChatGPT
GPT-6 Sol 和 GPT-6 Luna 已面向 Plus、Pro、Business、Enterprise 和 Edu 用户推送,可在 ChatGPT Work 和 Codex 中使用。
查看来源 -
Claude Opus 5.5 上线 OpenRouter,智能体编码等能力领先 Opus 5 — X:OpenRouter
Claude Opus 5.5 上线 OpenRouter,提供 100 万上下文窗口,定价为每百万输入 token 4 美元、输出 20 美元,比 Opus 5 更低。
查看来源 -
Qwen-Image-2.1 开源发布,登顶 Arena 图像编辑榜开源第一 — X:Arena
通义千问发布 Qwen-Image-2.1 开放权重版本,在 Arena Image Edit Arena 以 1367 分位列开源第一、总榜第 16,并登上 Text-to-Image Arena 开源第一。
查看来源 -
Boris Cherny 实测 Claude Opus 5.5:比 Fable 5.1 快且便宜 51% — X:Boris Cherny
在将 HAProxy 从 C 移植到 Rust的测试中,Claude Opus 5.5 用时 9.5 小时,快于 Fable 5.1 的 12 小时,成本低 51%,两者都通过了几乎所有测试。
查看来源 -
Anthropic 发布 Claude Opus 5.5,Claude 5.5 系列首个模型 — X:Claude
Anthropic 称 Claude Opus 5.5 在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。
查看来源
产品发布/更新
-
transformers 支持直接加载 GGUF 量化模型 — Hugging Face
transformers 现在可以通过from_pretrained传入gguf_file,直接加载 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核,本地推理性能接近 llama.cpp。
查看来源 -
OpenRouter 推出 Batch API,批量推理可享半价 — OpenRouter
Batch API 支持异步批量请求,由供应商在 24 小时窗口内完成,通常按正常 token 价格的 50% 或更低收费,目前已支持 70 多个模型。
查看来源 -
Kimi 发布浏览器扩展 — Kimi.ai
Kimi Browser Extension 可在浏览器侧边栏中对话,导航网页、填写表单并完成任务;用户还可以录制一次操作步骤保存为 skill,之后交由 Kimi 重复执行。
查看来源 -
Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型 — Claude Code
新版本支持 Claude Opus 5.5 和 100 万上下文,并将 Pro 与 Team Standard 计划的默认模型从 Sonnet 改为 Opus。
查看来源 -
LiteParse 9 月更新:PDFium 提速 20%—25% — LlamaIndex
LiteParse 2.14.6 通过内存分配优化,将文本提取耗时降低 20%—25%,平均每页耗时 2.76 毫秒,Markdown 渲染每页 3.94 毫秒。
查看来源 -
Apple 新款 Mac mini 与 Mac Studio 开售 — Apple
新款 Mac mini 搭载 M6 和 M5 Pro,新款 Mac Studio 搭载 M5 Max 和 M5 Ultra,Apple 称 Mac mini 的 AI 性能最高提升 4 倍。
查看来源 -
OpenAI 为 GPT-6 推出改进的提示词缓存系统与诊断工具 — OpenAI
新系统默认提高缓存命中率,对 30 分钟窗口内复用的合格共享前缀提供最高 90% 的缓存输入 token 折扣。
查看来源
行业动态
-
五角大楼内部审查称,过度依赖 Palantir Maven AI 系统导致误击伊朗学校 — Hacker News
据报道,美军今年 2 月误击伊朗 Minab 的一所小学,造成超过 150 人死亡,其中至少 123 名儿童。内部审查称,过度依赖 Palantir 开发的 Maven Smart System 是原因之一。
查看来源 -
Meta Muse 助手曝出严重 0-day 漏洞,Amazon 已开始封禁 Muse — Hacker News
该漏洞可能让本地应用或终端命令获取 Muse 账户认证 token,从而完全控制智能体。Meta 在披露约 12 小时后发布热修复补丁。
查看来源 -
Claude Opus 5.5 上架 Arena 的 Agent Arena 与 Battle Mode — Arena
Claude Opus 5.5 已进入 Agent Arena,用户可通过投票驱动排行榜。该评测允许模型使用网页搜索、文件系统和终端工具。
查看来源
论文研究
- Epoch AI:达到同等 AI 性能的成本每季度下降约 47% — Epoch AI
Epoch AI 估算,过去三年达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍。刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%。
查看来源
技巧与观点
-
Claude Opus 5.5 登顶 Artificial Analysis 智能指数,得分 58 — Artificial Analysis
评测显示 Claude Opus 5.5 以 58 分登顶 Artificial Analysis Intelligence Index;在 Terminal-Bench 4.0 上与 GPT-6 Astra 持平,得分为 59.6%。
查看来源 -
Artificial Analysis 评测 GPT-6 Sol 和 Luna:成本减半但各评测有升有降 — Artificial Analysis
GPT-6 Sol 和 Luna 的价格约为 GPT-5.6 同名型号的一半:Sol 为每百万输入和输出 token 2 美元、10 美元,Luna 为 0.10 美元、0.50 美元。
查看来源 -
实测对比 Grok 4.7 与小米 MiMo V2.6:后者成为性能、价格、速度的平衡方案 — 公众号:数字生命卡兹克
作者认为 Grok 4.7 的表现低于预期,而 MiMo V2.6 在性能、价格和速度之间取得了更好的平衡。
查看来源 -
Artificial Analysis 评测 Step 5 Preview:成本约为同级模型的 1/2.8 — X:Artificial Analysis
Step 5 Preview 在 Artificial Analysis Intelligence Index 中得 44 分,与 Kimi K3(max)持平;每任务成本约 0.72 美元,约为同级模型的 1/2.8。
查看来源 -
OpenRouter 实测 Jev 1.13 与 Claude Opus 5 的分类任务表现 — OpenRouter
在 Banking77 的 3080 条客服语料上,Jev 准确率为 81.0%,低于 Claude Opus 5 的 84.4%;但中位延迟仅 175 毫秒,约为 Opus 的 1/13,每千次请求成本为 0.11 美元,对比 Opus 的 2.42 美元。
查看来源 -
OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用 — OpenRouter
Nemotron 3.5 Lightning 是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频且边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra 形成分工。
查看来源