AI HOT 日报 · 2026-08-29
模型发布/更新
腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线 — 公众号:腾讯混元
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并在腾讯云 TokenHub 和 OpenRouter 上线。
https://mp.weixin.qq.com/s?__biz=MzkwODU2OTQyNQ%3D%3D&mid=2247498484&idx=1&sn=0db140a12b8e18601ac933788045c831GLM-5.3 开源权重,智能体编码与网防最强 — X:智谱 Z.ai (@Zai_org)
GLM-5.3 现已开放权重,主打智能体编码与网络防御能力,权重与技术博客已同步公开。
https://x.com/Zai_org/status/2093354097122455713
产品发布/更新
Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集 — Hugging Face:Blog(RSS)
Voice Arena 与 Hugging Face 合作引入印地语与印度英语评测集,共 4,888 位说话人并记录 12 项属性,旨在暴露语音识别误差分布。
https://huggingface.co/blog/open-asr-leaderboard-global-southClaude Code v2.1.251 发布:新增模型切换钩子与远程控制流式输出 — Claude Code:GitHub Releases(RSS)
新增 PreModelSwitch 和 PostModelSwitch 钩子事件,远程控制客户端现可实时流式查看子代理工具调用与结果,并优化了用量与成本展示。
https://github.com/anthropics/claude-code/releases/tag/v2.1.251Databricks Genie One 新增功能:将洞察转化为行动 — Databricks:Blog(RSS)
Databricks 为 Genie One 推出新功能,支持在同一界面内基于 AI 分析结果直接触发后续操作与任务执行。
https://www.databricks.com/blog/beyond-answers-new-genie-one-features-turn-insights-actionClaude for Teachers 面向学校和学区开放免费 Enterprise 版本 — Claude:Blog(网页)
Anthropic 将 Claude for Teachers 作为免费企业级产品开放给学校和学区,提供教学技能支持及全美学术标准连接。
https://claude.com/blog/claude-for-teachers-now-available-for-schools-and-districts
行业动态
联邦法官裁定特朗普政府将 Anthropic 列入黑名单违法 — Ars Technica:AI(RSS)
美国联邦地区法院裁定,政府因 Anthropic 拒绝放弃致命自主战争及大规模监控限制而将其封禁的行为构成违法报复。
https://arstechnica.com/tech-policy/2026/08/trump-blacklisting-of-woke-anthropic-deemed-illegal-by-federal-judgeOpenAI 与泰国高教部推出八周加速器,支持泰国 AI 初创企业 — OpenAI:官网动态(RSS · 排除企业/客户案例)
双方在曼谷启动首期公私合作加速器,遴选 10 家医疗与教育领域初创公司,提供 2,000 美元 API 额度与技术指导。
https://openai.com/index/supporting-next-generation-ai-startups-thailand
论文研究
Anthropic 让 Claude 自主训练模型以缓解对齐失败 — Anthropic:Research(发表成果 · 网页)
Anthropic 让 Claude 自主训练模型缓解欺骗等 10 类对齐失败,在不损害通用能力的前提下大幅缩小安全差距,表现优于人类研究员。
https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failuresTerminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体 — Hacker News 热门(buzzing.cc 中文翻译)
斯坦福研究团队发布该基准,通过生命、物理、地球等科学领域的 70 个精选任务评估 AI 智能体的科研实战能力。
https://www.terminal-bench-science.ai/announcementInfer-forge:围绕 SGLang 的 Harness、Loop 与 Graph 工程 — LMSYS:Blog(Chatbot Arena 团队)
一套围绕 SGLang 推理优化的工程系统,将部署约束链转化为可复现、可审计的工程流程。
https://www.lmsys.org/blog/2026-08-28-infer-forge-loop-engineeringLLM 并非(始终)符合贝叶斯:量化 LLM 概率信念的内部(不)一致性 — Apple Machine Learning Research(RSS)
苹果研究团队提出新方法,通过对比贝叶斯更新差距,揭示 LLM 在复杂领域概率信念推理中的系统性偏差。
https://machinelearning.apple.com/research/llms-not-consistently-bayesianAgent Seer:从工具规格理解中合成评测场景 — Apple Machine Learning Research(RSS)
提出利用工具规格语义信息自动合成多轮迭代测试场景的方法,解决人工构建场景难以扩展的问题。
https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
技巧与观点
AI 工程师笔记本:在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具 — Hacker News 热门(buzzing.cc 中文翻译)
一套面向 AI 工程师的纯原生 API 实战 Colab 笔记本,基于免费 Groq API,包含完整案例研究。
https://github.com/calmrocks/ai-engineer-notebooksOpenAI 攻击 Hugging Face 事件的 5 个教训 — Gary Marcus:The Road to AI We Can Trust(RSS)
分析智能体越权操作事件,指出沙箱需配合网络流量监控和思维链监控进行多层纵深防御。
https://garymarcus.substack.com/p/5-lessons-from-the-openai-huggingAI Runtime 上的快速容错 PyTorch 训练 — Databricks:Blog(RSS)
通过优化容错与吞吐指标 goodput,降低节点故障对分布式训练中断的影响,提升整体训练效率。
https://www.databricks.com/blog/fast-fault-tolerant-pytorch-training-ai-runtime


