AI HOT 日报 · 2026-07-25
模型发布/更新
Anthropic 发布 Claude Opus 5 — Anthropic:Newsroom(网页)
Claude Opus 5 智能水平接近 Claude Fable 5,但价格减半;在 Frontier-Bench v0.1 和 ARC-AGI 3 上表现突出。
https://www.anthropic.com/news/claude-opus-5蚂蚁百灵发布 Ling-3.0-flash 原生混合推理模型 — 公众号:蚂蚁百灵(Ling)
总参数 124B、激活参数 5.1B,在推理、指令遵循与长文本上表现强,长输入下 TTFT 明显降低。
https://mp.weixin.qq.com/s/5ic54FCsy334JJsQcyBr1gFLUX 3 x mimic:新一代视频动作模型 — Hacker News 热门(buzzing.cc 中文翻译)
多模态基础模型联合训练图像、视频和音频,并已在奥迪生产线上测试部署。
https://bfl.ai/blog/flux-3-mimicMidjourney V8.2 发布:专注美学提升与个性化理解 — Midjourney:Updates(RSS)
新版本重点提升图像美学、创意与个性化表现,减少低质量图像出现。
https://updates.midjourney.com/version-8-2Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频 — IT之家(RSS)
统一架构联合学习图像、视频和音频,支持文生视频、图生视频与多镜头串联。
https://www.ithome.com/0/981/137.htm
产品发布/更新
Runway Agent 推出自然语言工作流功能 — X:Runway (@runwayml)
可通过自然语言构建、运行或编辑基于节点的工作流,降低复杂工作流门槛。
https://x.com/runwayml/status/2080649234672439389百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行 — 公众号:百度智能云(文心)
支持多端互联与跨设备接力,桌面端可自动打开多个网页执行调研和下载。
https://mp.weixin.qq.com/s/HRySK1LU53clPe2I_M-FugOpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属 — OpenRouter:Announcements(RSS)
支持自定义分类法,对 AI 请求的用途、部门和合规类别自动打标并做成本分析。
https://openrouter.ai/blog/announcements/classifiersClaude Code v2.1.219 发布:新增 Claude Opus 5,支持 1M 上下文与嵌套子智能体 — Claude Code:GitHub Releases(RSS)
新版本加入 Opus 5,支持 1M 上下文窗口,并强化了子智能体能力。
https://github.com/anthropics/claude-code/releases/tag/v2.1.219
行业动态
英伟达、微软和 Meta 联合警告:应避免对开放权重模型过度监管 — Hacker News 热门(buzzing.cc 中文翻译)
三家公司强调开放权重模型对创新、研究和竞争力的重要性。
https://www.cnbc.com/2026/07/24/nvidia-microsoft-meta-open-weight-ai-models.html微软阐述开源模型助力美国竞争力路径 — X:Satya Nadella (@satyanadella)
微软强调开放权重模型对 AI 生态的重要性,并呼吁在安全前提下增强竞争力。
https://x.com/satyanadella/status/2080646162483417097Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因 — The Decoder:AI News(RSS)
测试显示 Kimi K3 在 ExploitBench 上显著落后于美国领先模型。
https://the-decoder.com/kimi-k3-trails-frontier-us-models-by-a-wide-margin-on-cyber-exploits-and-distillation-may-explain-why
论文研究
Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力 — Anthropic:Research(发表成果 · 网页)
新基准将无人机任务拆解为定位、导航、检测与跟随等子任务,用于评估物理世界操控能力。
https://www.anthropic.com/research/project-pilotApple 提出 LEAD 方法,破解长程推理中的“不可恢复瓶颈” — Apple Machine Learning Research(RSS)
通过短程未来验证与聚合,缓解长程执行中的不可逆错误累积问题。
https://machinelearning.apple.com/research/lead-no-recovery-bottleneck
技巧与观点
Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用 — Hacker News 热门(buzzing.cc 中文翻译)
通过本地反向代理刷新提示缓存,减少缓存过期带来的额外成本。
https://github.com/izeigerman/claude-thermosClaude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80% — Claude:Blog(网页)
Anthropic 为新一代模型大幅精简系统提示词,而编码评测没有明显损失。
https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-modelsClaude Design 产品设计师 Nate Parrott 分享如何用其探索视觉创意 — Claude:Blog(网页)
通过 HTML 交互能力做原型、幻灯片和动画迭代,把早期创意和生产开发连接起来。
https://claude.com/blog/how-the-product-designer-who-built-claude-design-uses-it-to-explore-ideas-before-building-themClaude 模型家族详解:如何为工作负载选择最佳模型 — Claude:Blog(网页)
Anthropic 将模型按能力、推理密度和成本速度划分,方便按任务选型。
https://claude.com/blog/claude-models-explained-choosing-the-best-model-for-your-use-case


