AI HOT 日报 · 2026-09-03
模型发布/更新
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型 — Google DeepMind:Blog
Google DeepMind 正式推出 Gemini 3.8 Flash 及专为网络与代码安全场景优化的 3.8 Flash Cyber 模型。
https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyberMeta 发布 Muse Spark 1.3,智能体与科学推理能力提升 — X:Alexandr Wang
Meta 推出五个月内的第四个 Muse Spark 版本,其中 xhigh 版在 Artificial Analysis Intelligence Index 评测中达到 61 分,大幅增强智能体与科学推理表现。
https://x.com/alexandr_wang/status/2095249704888197175Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿 — X:通义千问 / Qwen
通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 评测中以 1,691 分首秀即登顶总榜,并以 $5/MToken 混合定价领跑 Pareto 效率前沿,现已在 QwenCloud 开放。
https://x.com/Alibaba_Qwen/status/2094982928371794077
产品发布/更新
Claude 在 Cowork 和 Claude Code 中支持后台操作电脑 — X:Claude
Claude 官方宣布 Claude Cowork 与 Claude Code 新增后台系统级操作能力,用户派发任务后可在后台自动模拟点击、输入与应用调用。
https://x.com/claudeai/status/2095226833293685100Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行 — Cursor Blog
Cursor 推出 Self-Hosted Machines 架构,推理规划保留在云端,工具执行通过安全出站连接迁移至企业内部网络机器。
https://cursor.com/blog/self-hosted-machines美团 LongCat-2.0 上线 Cline 免费试用 — X:美团 LongCat
美团 LongCat-2.0 正式接入 Cline 插件生态并开放免费体验。
https://x.com/Meituan_LongCat/status/2094996391387111865UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验 — 公众号:数字生命卡兹克
UU远程更新重点强化终端能力,支持完整 TUI 交互渲染、Mac 免密登录、移动端独立输入框以及跨端终端会话接管(uuyc-cli lterm)。
https://mp.weixin.qq.com/s?__biz=MzIyMzA5NjEyMA%3D%3D&mid=2647685772&idx=1&sn=a073c30899a7f420147673def8209609
行业动态
Nvidia 接近以 129 亿美元收购 Hugging Face — X:Rohan Paul
据 Bloomberg 报道,Nvidia 正洽谈以约 129 亿美元(总额或达 140 亿美元含 10 亿美元留任计划)收购开源平台 Hugging Face,交易估值约为上一轮融资的 2.9 倍。
https://x.com/rohanpaul_ai/status/2094975190468010368OpenAI 因 Tumbler Ridge 枪击案面临 30 起新诉讼,被指协助教唆 — The Verge
加州联邦法院收到 30 起针对 OpenAI 及 CEO Sam Altman 的诉讼,指控其为加拿大校园枪击案涉案人员提供实质性协助与建议。
https://www.theverge.com/ai-artificial-intelligence/988261/openai-tumbler-ridge-shooting-lawsuit-aiding-abetting
技巧与观点
美国司法部就 OpenAI 版权诉讼提交意见书支持训练属于合理使用 — X:Rohan Paul
美司法部在 OpenAI 与纽约时报诉讼中递交非约束性意见书,主张受版权保护文本用于大模型训练具备高度转换性,一般应属合理使用,全面许可要求可能损害美国 AI 竞争力。
https://x.com/rohanpaul_ai/status/2095197606884573208什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环 — Google AI Blog
Google 分享 harness 工程实践,通过在 LLM 外围包裹编排层、执行沙箱、状态持久化与验证工具,实现免人工逐行审查的代码自愈循环。
https://dev.to/googleai/what-is-harness-engineering-and-why-should-i-care-8n0Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准 — Google AI Blog
Google AI 团队总结布尔式评测准则:拆分原子化无重叠问题、仅评估客观事实、限定在 Prompt 要求范围内,并通过专家标注 Golden Set 校准评判模型。
https://dev.to/googleai/how-to-write-reliable-rubrics-for-llm-as-a-judge-evaluations-ndpAnthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现 — Claude Blog
Anthropic 总结电商落地经验,推荐使用单 Claude 结合工具技能的主 Agent 架构,并开源包含购物与商家 Agent 的参考项目。
https://claude.com/blog/the-anatomy-of-effective-commerce-agentsGitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本 — GitHub Blog
GitHub 分享 Copilot 降本四策略:压缩工具输出、去除 view 行号前缀(推理成本降 3%~5%)、精简 task 提示词(每轮省 1300 token)及异步任务直出结果。
https://github.blog/ai-and-ml/github-copilot/how-we-make-ai-coding-more-cost-efficient-without-sacrificing-task-qualityGoogle 总结 AI Agents Challenge 中最强提交背后的 4 个工程模式 — Google Developers Blog
Google 复盘智能体大赛头部方案,提炼出双向 MCP、事件驱动并发、同标准回退与分层路由四大核心工程模式。
https://developers.googleblog.com/4-engineering-patterns-behind-the-strongest-ai-agents-challenge-submissions


