AI HOT 日报 · 2026-07-25

gusi
gusi
·5 min read

AI HOT 日报 · 2026-07-25

模型发布/更新

  1. Anthropic 发布 Claude Opus 5 — Anthropic:Newsroom(网页)
    Claude Opus 5 智能水平接近 Claude Fable 5,但价格减半;在 Frontier-Bench v0.1 和 ARC-AGI 3 上表现突出。
    https://www.anthropic.com/news/claude-opus-5

  2. 蚂蚁百灵发布 Ling-3.0-flash 原生混合推理模型 — 公众号:蚂蚁百灵(Ling)
    总参数 124B、激活参数 5.1B,在推理、指令遵循与长文本上表现强,长输入下 TTFT 明显降低。
    https://mp.weixin.qq.com/s/5ic54FCsy334JJsQcyBr1g

  3. FLUX 3 x mimic:新一代视频动作模型 — Hacker News 热门(buzzing.cc 中文翻译)
    多模态基础模型联合训练图像、视频和音频,并已在奥迪生产线上测试部署。
    https://bfl.ai/blog/flux-3-mimic

  4. Midjourney V8.2 发布:专注美学提升与个性化理解 — Midjourney:Updates(RSS)
    新版本重点提升图像美学、创意与个性化表现,减少低质量图像出现。
    https://updates.midjourney.com/version-8-2

  5. Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频 — IT之家(RSS)
    统一架构联合学习图像、视频和音频,支持文生视频、图生视频与多镜头串联。
    https://www.ithome.com/0/981/137.htm

产品发布/更新

  1. Runway Agent 推出自然语言工作流功能 — X:Runway (@runwayml)
    可通过自然语言构建、运行或编辑基于节点的工作流,降低复杂工作流门槛。
    https://x.com/runwayml/status/2080649234672439389

  2. 百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行 — 公众号:百度智能云(文心)
    支持多端互联与跨设备接力,桌面端可自动打开多个网页执行调研和下载。
    https://mp.weixin.qq.com/s/HRySK1LU53clPe2I_M-Fug

  3. OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属 — OpenRouter:Announcements(RSS)
    支持自定义分类法,对 AI 请求的用途、部门和合规类别自动打标并做成本分析。
    https://openrouter.ai/blog/announcements/classifiers

  4. Claude Code v2.1.219 发布:新增 Claude Opus 5,支持 1M 上下文与嵌套子智能体 — Claude Code:GitHub Releases(RSS)
    新版本加入 Opus 5,支持 1M 上下文窗口,并强化了子智能体能力。
    https://github.com/anthropics/claude-code/releases/tag/v2.1.219

行业动态

  1. 英伟达、微软和 Meta 联合警告:应避免对开放权重模型过度监管 — Hacker News 热门(buzzing.cc 中文翻译)
    三家公司强调开放权重模型对创新、研究和竞争力的重要性。
    https://www.cnbc.com/2026/07/24/nvidia-microsoft-meta-open-weight-ai-models.html

  2. 微软阐述开源模型助力美国竞争力路径 — X:Satya Nadella (@satyanadella)
    微软强调开放权重模型对 AI 生态的重要性,并呼吁在安全前提下增强竞争力。
    https://x.com/satyanadella/status/2080646162483417097

  3. Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因 — The Decoder:AI News(RSS)
    测试显示 Kimi K3 在 ExploitBench 上显著落后于美国领先模型。
    https://the-decoder.com/kimi-k3-trails-frontier-us-models-by-a-wide-margin-on-cyber-exploits-and-distillation-may-explain-why

论文研究

  1. Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力 — Anthropic:Research(发表成果 · 网页)
    新基准将无人机任务拆解为定位、导航、检测与跟随等子任务,用于评估物理世界操控能力。
    https://www.anthropic.com/research/project-pilot

  2. Apple 提出 LEAD 方法,破解长程推理中的“不可恢复瓶颈” — Apple Machine Learning Research(RSS)
    通过短程未来验证与聚合,缓解长程执行中的不可逆错误累积问题。
    https://machinelearning.apple.com/research/lead-no-recovery-bottleneck

技巧与观点

  1. Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用 — Hacker News 热门(buzzing.cc 中文翻译)
    通过本地反向代理刷新提示缓存,减少缓存过期带来的额外成本。
    https://github.com/izeigerman/claude-thermos

  2. Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80% — Claude:Blog(网页)
    Anthropic 为新一代模型大幅精简系统提示词,而编码评测没有明显损失。
    https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models

  3. Claude Design 产品设计师 Nate Parrott 分享如何用其探索视觉创意 — Claude:Blog(网页)
    通过 HTML 交互能力做原型、幻灯片和动画迭代,把早期创意和生产开发连接起来。
    https://claude.com/blog/how-the-product-designer-who-built-claude-design-uses-it-to-explore-ideas-before-building-them

  4. Claude 模型家族详解:如何为工作负载选择最佳模型 — Claude:Blog(网页)
    Anthropic 将模型按能力、推理密度和成本速度划分,方便按任务选型。
    https://claude.com/blog/claude-models-explained-choosing-the-best-model-for-your-use-case