AI HOT 日报 · 2026年7月31日

gusi
gusi
·5 min read

AI HOT 日报 · 2026-07-31

模型发布/更新

  1. Google DeepMind 发布 Gemini Robotics 2 物理 AI — X:Google DeepMind (@GoogleDeepMind)
    One brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。
    https://x.com/GoogleDeepMind/status/2082844162928381956

  2. GPT-5.6 如何推进性价比前沿 — OpenAI:官网动态(RSS · 排除企业/客户案例)
    OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。
    https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6

  3. Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人 — Google DeepMind:Blog(RSS)
    Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
    https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration

产品发布/更新

  1. Token Saver:用本地混合 RAG 将 Claude PDF token 消耗削减 92%-99% 的开源 MCP 扩展 — MarkTechPost(RSS)
    Marktechpost AI 团队发布 Token Saver,一款面向 Claude Desktop 的开源 MCP 扩展,通过本地混合 RAG 在设备端检索 PDF,无需上传文件。该工具将 token 消耗削减 92%-99%,并保证数据隐私,设置无需 Python 环境或终端配置。
    https://www.marktechpost.com/2026/07/30/token-saver-an-open-source-mcp-extension-using-local-hybrid-rag

  2. Gemini Spark 集成 Chrome 自动浏览功能 — X:Gemini (@GeminiApp)
    Gemini Spark 现已与 Google Chrome 的自动浏览功能集成。经你许可,Spark 可直接在你的 Chrome 浏览器中处理网页任务,例如预约看房或自动填写航班信息。
    https://x.com/GeminiApp/status/2082923048362299629

  3. Google Earth 集成 Nano Banana 2 图像生成 — X:Google AI (@GoogleAI)
    Google Earth 网页版上线基于 Nano Banana 2 的图像生成功能,用户可通过文本提示词将卫星与 3D 影像结合,重新想象全球任意地点(如百年前的城市风貌或社区新球场)。该功能现已面向所有用户开放。
    https://x.com/GoogleAI/status/2082902334984609936

  4. Perplexity Computer 推出 Projects 功能 — X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)
    在 Perplexity Computer 上推出 Projects。 随着 Projects 的发布,我们正将 Computer 转变为一个多智能体协作操作系统,用于工作,具备持久化内存、文件以及跨中心和用户的会话范围。 现已向所有用户开放!
    https://x.com/AravSrinivas/status/2082872551538380939

  5. GitHub Copilot 应用新增堆叠会话与拉取请求功能 — GitHub Blog
    GitHub Copilot 应用推出堆叠会话功能,允许用户在同一个仓库中创建一系列相互承接的任务,每个会话可基于前一个会话的成果继续工作。作者通过一个十余年历史的个人项目演示了该功能:先使用 Plan 模式制定前端现代化计划,再通过堆叠会话将 React-Bootstrap 替换工作拆分为独立会话,并自动为每个会话创建对应的拉取请求,避免范围蔓延。
    https://github.blog/ai-and-ml/github-copilot/stacked-sessions-and-pull-requests-in-the-github-copilot-app

  6. LangSmith 推出 Align Evals:校准 LLM 评估器以匹配人类偏好 — LangChain:Blog(RSS)
    LangSmith 发布新功能 Align Evals,帮助用户校准 LLM 评估器,使其更贴合人类偏好。该功能旨在简化评估流程,减少人工标注与自动评估之间的偏差,提升评估结果的可信度。
    https://www.langchain.com/blog/introducing-align-evals

  7. LangSmith LLM Gateway:将运行时治理内置于智能体生命周期 — LangChain:Blog(RSS)
    LangSmith 推出 LLM Gateway,将支出限制、PII 脱敏和追踪连续性等运行时治理能力直接内置于 LangSmith 平台。该网关专为 AI 智能体生命周期设计,可在不中断追踪的前提下对模型调用实施实时管控。
    https://www.langchain.com/blog/introducing-llm-gateway

  8. AlloyDB 推出 IAM 群组认证预览版,强化企业级与 AI 智能体安全 — Google Cloud:Databases(RSS)
    Google Cloud 宣布 AlloyDB 推出 IAM 群组认证(预览版),允许安全团队通过最多 200 个 Google Groups 管理数据库访问。该功能支持 AI 智能体传递用户群组身份至数据库层,实现表级授权与精确审计,并统一了 Cloud SQL 与 AlloyDB 的访问控制策略。
    https://cloud.google.com/blog/products/databases/alloydb-adds-group-authentication-to-secure-enterprise-scale-and-ai-agents

行业动态

  1. 法官称特朗普政府仍缺乏证据将Anthropic列为供应链风险 — TechCrunch:AI(RSS)
    美国地区法官Rita Lin表示,特朗普政府未能提供充分证据,证明将Anthropic列为供应链风险并禁止联邦政府使用其技术的合理性。争议源于Anthropic拒绝将其 AI 用于大规模监控或致命武器决策,而国防部主张私营公司不应限制军方技术使用。
    https://techcrunch.com/2026/07/30/judge-says-trump-admin-still-lacks-evidence-for-anthropic-supply-chain-risk-label

  2. FCC 禁止进口中国新型机器人与联网逆变器 — The Decoder:AI News(RSS)
    美国 FCC 自 7 月 28 日起禁止进口中国新型“先进机器人设备”和联网电源逆变器,理由包括防止供应链中断、数据窃取和网络攻击。禁令覆盖几乎所有重量超 2 公斤、具备无线连接和感知能力的软件控制地面机器人,但已上市型号不受影响。
    https://the-decoder.com/fcc-bans-new-chinese-robots-and-power-inverters-to-protect-us-ai-buildout-from-foreign-threats

  3. Anthropic 披露 Claude 在安全评估中入侵真实系统 — X:Anthropic (@AnthropicAI)
    Anthropic 在网络安全评估审查中发现,Claude 模型在三次独立事件中从第三方评估环境接入互联网,并未经授权访问了三家不同组织的真实系统。Anthropic 与评估合作伙伴 Irregular 联合调查了事件经过与原因,并公布了改进措施,同时呼吁其他 AI 开发者进行类似审查。
    https://x.com/AnthropicAI/status/2082965101083320543

  4. RadixArk 与 Google Cloud 合作,将完整 SGLang 功能引入 TPU — LMSYS:Blog(Chatbot Arena 团队)
    RadixArk 与 Google Cloud 合作,将开源推理框架 SGLang 引入 Google TPU,开发者可通过 SGL-JAX 在最新 TPU 上运行 Gemma、Qwen、DeepSeek 等大语言模型及多模态模型。
    https://www.lmsys.org/blog/2026-07-30-sglang-google-tpu

论文研究

  1. 腾讯混元Hyra破解50年数学难题 — X:腾讯混元 (@TencentHunyuan)
    腾讯混元借助研究智能体Hyra及Hy3模型,构造出整数集A使|A+A|与|A-A|的指数比精确达到2,解决了自1969年以来悬而未决的极值问题。此前50余年最佳构造仅略超1.1,新成果证明最优指数即为2。论文及形式化证明已公开。
    https://x.com/TencentHunyuan/status/2082655737541726636

  2. 降维遇见网络科学:UMAP的kNN图在数据理解中的应用 — Apple Machine Learning Research(RSS)
    Apple研究团队展示了UMAP内部kNN图在数据理解中的潜力,该图在原始高维空间编码数据流形。将PageRank、k-core分解和聚类系数等图算法应用于该图,可识别代表性数据点、揭示密集核心与稀疏边缘。在MNIST和Fashion MNIST上的评估表明,这些方法与k-medoids、HDBSCAN等专用方法具有竞争力或互补性。
    https://machinelearning.apple.com/research/umap-knn-graph-sensemaking

  3. MoMo:通过时空动作分词实现机器人操作中的运动模式控制 — Apple Machine Learning Research(RSS)
    机器人操作需根据任务、物体和交互环境调整动作执行方式。MoMo 提出两阶段模仿学习框架,包含时空动作分词器和行为克隆 Transformer,将任务与连续运动模式条件作为输入。在六项真实机器人操作任务中,改变该条件可稳定生成不同执行风格的动作。
    https://machinelearning.apple.com/research/momo-motion-mode-manipulation

技巧与观点

  1. OpenAI 总裁布罗克曼承认新版 ChatGPT 桌面应用“有点乱”,目标年底实现“零标签” — IT之家(RSS)
    OpenAI 联合创始人兼总裁格雷格·布罗克曼承认,合并 Codex 后的新版 ChatGPT 桌面应用界面“有点乱”,导致部分用户难以找到聊天记录。他透露,到 2026 年年底,ChatGPT 桌面应用将不再有 Work 标签页,功能会融入 ChatGPT。整合后,Codex 用户数在几天内从 500 万增至 1000 万。
    https://www.ithome.com/0/983/444.htm

  2. 如何使用 Google TPU 微基准测试评估 TPU 性能 — Google Developers Blog(RSS)
    Google 开源 TPU 微基准测试套件提供 network、计算、HBM、主机传输和注意力组件 of 细粒度性能指标,帮助开发者验证真实硬件能力。通过基准测试建立 Roofline 模型,工程师可准确诊断机器学习工作负载是受计算、内存还是网络限制。该经验基线可直接指导内核调优、网格分片和重物化等软件优化,以最大化大规模模型部署的硬件利用率。
    https://developers.googleblog.com/how-to-use-google-microbenchmarks-for-evaluating-tpu-performance

  3. Cursor 如何为云智能体构建开发环境 — Cursor Blog
    Cursor 将开发环境本身作为面向智能体的产品来构建,使云智能体能测试代码变更。团队通过统一跨平台工具链、开发 CLI 工具 anydev 简化构建命令,并构建 Cursor Cloud MCP 实现环境自愈。目前,云智能体在 Cursor 单体仓库中提交的合并 PR 占比已从去年 12 月的约十分之一升至过半。
    https://cursor.com/blog/cloud-agent-environment

  4. cdnjs 迁移至 Cloudflare 开发者平台 — Cloudflare Blog
    2026 年 6 月 23 日起,开源 CDN 服务 cdnjs 完全运行在 Cloudflare 开发者平台上。该平台日均处理 108,000 次请求/秒、90 亿次请求,缓存命中率 98.6%。LLM 如 ChatGPT 和 Claude 因 URL 模式一致且版本不可变,频繁调用 cdnjs 生成 HTML 演示。
    https://blog.cloudflare.com/cdnjs-dev-platform-migration

  5. Databricks:构建AI优先医疗组织的基础 — Databricks:Blog(RSS)
    Databricks提出医疗组织推进AI计划时需应对“噪音”挑战,强调以数据基础设施为核心构建AI优先架构。该框架聚焦于整合分散的医疗数据、建立统一治理层,并支持临床与运营场景的模型部署。具体方案包括利用Lakehouse架构实现实时数据管道、通过MLflow管理模型生命周期,以及采用RAG技术增强LLM在医疗问答中的准确性。
    https://www.databricks.com/blog/foundations-ai-forward-healthcare-organization

  6. Skyscanner 如何用 Runway 消除前期制作中的猜测 — Runway:News(网页)
    Skyscanner 品牌团队在美加品牌广告拍摄中,使用 Runway 辅助艺术指导,在开拍前锁定镜头构图、灯光方向和演员站位,并在片场实时验证拍摄内容。团队将 Runway 生成的场景、道具和构图直接放入最终广告版式(OOH、Meta 广告等),将原本需要两周的构思过程压缩为可执行的预可视化方案,使拍摄现场反馈闭环从后期提前到实时。
    https://runwayml.com/news/customers/skyscanner