AI HOT 日报 · 2026-09-04
模型发布/更新
OpenAI 发布 GPT-6 Astra:1.05M 上下文的计算机操作模型,因触及 Critical 网络安全阈值而限制访问 — MarkTechPost(RSS)
OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文窗口、128,000 最大输出 token,2026 年 4 月 30 日知识截止,OSWorld V2-Offline 得分 72.6%(GPT-5.6 Sol 为 65.7%),平均任务时间从约 75 分钟降至 40 分钟。
https://www.marktechpost.com/2026/09/03/openai-releases-gpt-6-astra-a-1-05m-context-computer-use-model-gated-behind-a-critical-cyber-thresholdOpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议 — TechCrunch:AI(RSS)
OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。
https://techcrunch.com/2026/09/03/openai-launches-astra-its-powerful-and-controversial-new-modelOpenAI 开始发布 GPT-6 Astra,面向全部 Plus 用户开放 — X:Tibo (@thsottiaux)
OpenAI 宣布开始发布 GPT-6 Astra,重点让全部 Plus 用户可用,而不只限 Pro、Business 和 Enterprise 套餐。发布需几天完成,背后多个全新系统将首次大规模运行。
https://x.com/thsottiaux/status/2095597168816226335OpenAI 发布 GPT-6 Astra,多项基准达到 SOTA — X:Sherwin Wu(@sherwinwu)
OpenAI 发布 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 上达到 SOTA,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。
https://x.com/sherwinwu/status/2095608486940086448IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期 — Hacker News 热门(buzzing.cc 中文翻译)
IFM 发布 K2 Horizon 模型系列,共六个模型(0.9B 到 375B-A23B),均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。
https://ifm.ai/blog/k2OpenAI 发布 GPT-6 Astra,首个达到关键级网络安全能力门槛的模型 — IT之家(RSS)
OpenAI 于 9 月 3 日发布新一代大语言模型 GPT-6 Astra,是其首个达到准备框架中关键级网络安全能力门槛的模型,可在无逐步指导下发现防护严密系统的未知漏洞。
https://www.ithome.com/0/998/208.htmOpenAI 发布 GPT-6 Astra,官方基准显示 ARC-AGI-3 得分 99.9% — X:Kim (@kimmonismus)
OpenAI 发布 GPT-6 Astra,官方基准显示其在 ARC-AGI-3 测试中达到 99.9%。
https://x.com/kimmonismus/status/2095585966102614182OpenAI 发布 GPT-6 Astra,基准全面超越 Claude Fable 5.1 — X:Kim (@kimmonismus)
GPT-6 Astra 在 ARC-AGI-3 达 99.9%,ExploitBench 得 100%,在各项基准上全面超过此前保持 SOTA 的 Claude Fable 5.1,且价格更低。
https://x.com/kimmonismus/status/2095589174686400914
产品发布/更新
Hugging Face 发布开源工具 funes,为编码智能体提供可本地持有的记忆层 — Hugging Face:Blog(RSS)
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地记忆层,把已有会话记录索引成 Lance 数据集,让 Agent 自主召回原始出处。
https://huggingface.co/blog/funesxAI 设计 Grok Bot:为持久化智能体重构交互界面 — xAI:News(网页)
xAI 发布设计文章,介绍 Grok Bot 如何为超越单次会话的持久化智能体设计界面。产品以 Bot 为主要对象而非会话,Bot 拥有身份、记忆、自己的计算机和工具。
https://x.ai/news/designing-grok-botOpenAI 推出 Daybreak for Frontline Defenders,投入10亿美元支持一线网络防御 — OpenAI:官网动态(RSS · 排除企业/客户案例)
OpenAI 发布 Daybreak for Frontline Defenders 全球计划,承诺提供 10 亿美元的 Daybreak 补贴访问、培训、技术支持与合作,优先支持水处理、电网、地方政府等一线防御者。
https://openai.com/index/daybreak-for-frontline-defendersxAI 发布 Grok Bot 企业版,Grok 与 Cursor Enterprise 客户两周免费 — xAI:News(网页)
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用并邀请全组织成员。
https://x.ai/news/grok-bot-for-enterprise
行业动态
- NVIDIA 宣布以 129.303 亿美元收购 Hugging Face — NVIDIA Blog(RSS)
NVIDIA 宣布已同意以 12,930,300,000 美元收购 Hugging Face,黄仁勋在官方博客公布了消息。Hugging Face 目前服务超 1800 万开发者,托管超 300 万个模型与 100 万个应用。
https://blogs.nvidia.com/blog/nvidia-to-acquire-hugging-face
技巧与观点
Artificial Analysis 评测 GPT-6 Astra:编码智能体追平 Fable 5 但价格涨至 2.5 倍 — X:Artificial Analysis (@ArtificialAnlys)
Artificial Analysis 发布评测,GPT-6 Astra 的 Coding Agent Index 得分 67,约等于 Claude Opus 5 和 Fable 5,成本不到 Fable 5 的一半;token 效率比 GPT-5.6 Sol (max) 高约 70%。
https://x.com/ArtificialAnlys/status/2095595489031000350François Chollet 评 GPT-6 Astra 在 ARC-AGI-3 上的表现 — X:Francois Chollet (@fchollet)
François Chollet 发文称 GPT-6 Astra 在交互式推理任务上带来阶跃式能力提升,使用标准 harness 在 ARC-AGI-3 上得 66%,配合持续对话 harness 和自定义 compaction 接近 100%。
https://x.com/fchollet/status/2095598451115614371Rohan Paul 解读 OpenAI GPT-6 Astra 117 页系统卡中的安全发现 — X:Rohan Paul (@rohanpaul_ai)
梳理 GPT-6 Astra 117 页系统卡要点:Astra 控制自身链式思维的能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,可监控性相应下降。
https://x.com/rohanpaul_ai/status/2095616781880869271Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑 — Gary Marcus:The Road to AI We Can Trust(RSS)
Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,但鲁棒性与监控性仍需观察。
https://garymarcus.substack.com/p/hot-take-on-gpt-6-astraTom Tunguz 解析 Meta Muse Spark 双轨定价背后的数据换算力逻辑 — Tomer Tunguz 博客(VC 分析)
Tom Tunguz 分析 Meta 发布 Muse Spark 模型及双轨 API 定价:Standard Tier 输入 $1.25/m,探讨背后数据换算力商业逻辑。
https://tomtunguz.com/the-ads-model-for-prompts-vertically-integrates-aiGoogle Cloud 教你用 Cloud Run instances 以每月 $5.70 搭建常驻 Agent — Google AI:DEV 作者专属(RSS)
Google AI 开发者博客介绍如何用 Cloud Run instances 以每月 $5.70(1 vCPU、1Gi 内存、共享 CPU)在云端 24/7 运行常驻 Agent。
https://dev.to/googleai/build-a-long-running-agent-in-the-cloud-for-570month-113cMeta Muse Spark 1.3 在 Artificial Analysis 编码智能体指数中与 Claude 组合对比评测结果公布 — X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
Artificial Analysis 编码智能体指数显示,Meta Muse Spark 1.3 (max) 在 Muse Code 下得 68 分,仅次于 Claude Code + Opus 5 (xhigh) 的 68 分。
https://x.com/alexandr_wang/status/2095318449602138577ARC-AGI-3 发布仅半年即被 Astra 饱和,进展快于 François Chollet 预期一倍 — X:Sherwin Wu(@sherwinwu)
Sherwin Wu 表示 ARC-AGI-3 仅用 6 个月便被 Astra 饱和,快于 François Chollet 预期的一年,新一代模型能力正在重塑认知。
https://x.com/sherwinwu/status/2095608725730119733


