AI HOT 日报|2026年8月25日:AI 基础设施进入智能体效率竞争

gusi
gusi
·5 min read

AI HOT 日报 · 2026-08-25

今日导读

今天的 AI 动态集中在一个主线:AI 产业正在从单纯追求模型能力,转向围绕智能体工作负载的整体效率竞争。模型成本、推理吞吐、网络协议、芯片通信和企业 ROI,正在成为下一阶段落地的关键指标。

模型发布/更新

  1. GPT-5.6 登陆 Kiro,为开发者提升性价比 — OpenAI

    GPT-5.6 模型家族现已登陆软件开发智能体 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在 Kiro 内完成任务的成本降低约 82%。该更新由 OpenAI 与 AWS 合作优化,目标是用更少迭代和更高 token 价值帮助开发者产出更高质量的代码。

    阅读原文

产品发布/更新

  1. NVIDIA Vera Rubin NVL72 将 AI 智能体能效提升至新水平 — NVIDIA Blog

    NVIDIA 实测数据显示,Vera Rubin NVL72 在智能体工作负载下,每兆瓦吞吐量较 GB300 NVL72 最高提升 30 倍,每百万 token 成本降低至原来的约三十五分之一。

    阅读原文

  2. MetaRoCE:为 AI 规模以太网打造的 RDMA 传输协议 — Meta Engineering Blog

    Meta 设计并开源 MetaRoCE,并通过 Open Compute Project 发布规范、参考实现和合规测试套件。该协议支持乱序交付、多路径、无损容忍和双向拥塞控制,无需依赖 PFC,面向百万 GPU 规模的高吞吐、低尾延迟网络。

    阅读原文

  3. NVIDIA 推出 NVLink Fusion,让定制 XPU 接入 AI 工厂 — NVIDIA Blog

    NVLink Fusion 将定制 XPU 接入 NVIDIA 的 NVLink 扩展域,使 XPU 间端到端延迟较现成以太网方案低 3 倍,数据包速率高 10 倍。

    阅读原文

  4. MTIA 300:Meta 首款集成 NIC 与通信卸载引擎的训练芯片 — Meta Engineering Blog

    MTIA 300 面向推荐与排序模型训练优化,封装内集成 12 个 800 Gbps RDMA NIC,提供 1.2 TB/s 总 I/O 带宽,并通过专用消息引擎卸载通信,使大规模计算与集合通信并发时的吞吐损耗低于 0.5%。

    阅读原文

  5. NVIDIA 扩展 Vera Rubin 推理能力,Groq 3 LPX 全面投产 — NVIDIA Blog

    NVIDIA 宣布 Vera Rubin NVL72 将扩展快速 token 生成能力,配套的 NVIDIA Groq 3 LPX 机架级系统已全面投产,面向下一代智能体推理系统。

    阅读原文

行业动态

  1. Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI — Mistral AI

    双方将合作建设 AI 基础设施、开发先进模型并部署 AI 解决方案,初期聚焦网络安全、语音和阿拉伯语模型,合作金额达数亿欧元。

    阅读原文

  2. 丰田北美用 Deep Agents 和 LangSmith 规模化企业 AI — LangChain

    丰田北美已在生产环境运行 50 多个 AI 智能体,并将交付周期从 6 个月缩短至 4 天,同时通过 LangSmith 追踪 AI 投资回报率,为企业级规模化落地提供案例。

    阅读原文

论文研究

  1. Beyond Visual CoT:Internalized Visual Thinking 实现主动视频推理 — Apple Machine Learning Research

    新框架 IVT 在训练阶段内化视觉思考,推理时直接进行文本预测与优化,避免生成中间推理图像带来的额外成本,在不增加推理开销的前提下实现主动视频推理。

    阅读原文

技巧与观点

  1. OpenAI 正为一切构建 AI 智能体,但用户会交出控制权吗? — TechCrunch

OpenAI 正将 Codex 改造成面向非工程师的智能体产品 ChatGPT Work,试图让白领通过 LLM 自主完成多步骤工作。其核心挑战不再只是模型能力,而是用户是否愿意把真实工作流和决策权交给智能体。

阅读原文

  1. ADK 如何评估实时语音智能体 — Google Developers Blog

Google 为 ADK 增加原生实时评估能力,可用模拟用户驱动语音智能体,并对语音回复打分,在与文本智能体相似的评估循环中测试对话场景。

阅读原文

  1. Databricks 支持从本地 IDE 运行、调试和扩展云端工作负载 — Databricks

新功能打通本地开发环境与 Databricks 云平台,让开发者无需频繁切换上下文即可完成编码、测试和部署。

阅读原文

  1. 自动化 alt 文本检查通过,不代表无障碍体验真的合格 — GitHub Blog

GitHub 的 Accessibility Scanner 通过确定性规则检测缺失、文件名、占位符、泛化词和相邻重复等问题,并结合布局与视觉模型审查,减少“形式合规、实际不可用”的 alt 文本。

阅读原文

  1. Anthropic 市场团队用 Claude Code 为销售代表自动生成个性化更新 — Claude

Anthropic 市场团队通过 MCP 连接 BigQuery 和 CRM 数据,将销售报告转化为每位客户经理的个性化周一简报,并以“绝不编造 URL”等规则持续迭代内容质量。

阅读原文

今日判断

从模型成本到数据中心能效,再到网络协议、通信芯片和企业 ROI,AI 竞争的重点正在向“每一次智能体调用能产生多少有效工作”转移。对开发者和创业团队而言,单纯追逐更大的模型已经不够,围绕工作流、评估、成本控制和基础设施协同构建产品,可能更接近真实的商业价值。

数据来源:aihot.virxact.com。