AI HOT 日报 · 2026年8月11日

gusi
gusi
·5 min read

AI HOT 日报 · 2026-08-11

模型发布/更新

  1. SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理 — LMSYS:Blog(Chatbot Arena 团队)
    SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。
    https://www.lmsys.org/blog/2026-08-10-meta-muse-glimmer

  2. Meta 发布开源模型 Muse Glimmer — X:AI at Meta (@AIatMeta)
    推出 Muse Glimmer,一款开放权重、300 亿参数的模型,专为本地、常驻运行的智能体工作流优化。与同尺寸领先模型相比,Muse Glimmer 在关键智能体用例和基准测试中表现出色,并设计为完全在消费级硬件(如 Mac 或配备高性能 GPU 的 PC)上运行。以宽松的 Apache 2.0 许可证发布模型权重。
    https://x.com/AIatMeta/status/2086757844544811485

  3. OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型 — OpenAI:官网动态
    OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,用于授权的漏洞研究、漏洞验证和安全测试。该模型旨在应对网络防御窗口不断收窄的挑战,为安全研究人员提供专门工具。
    https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows

产品发布/更新

  1. OpenRouter 推出由市场智慧驱动的新版 Auto 路由器 — OpenRouter:Announcements
    OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。
    https://openrouter.ai/blog/announcements/introducing-the-new-auto-router

  2. 千问开放平台上线:租房、寄快递、查理财等十余领域服务可对话办理 — 公众号:千问APP(阿里)
    千问开放平台今日上线,面向生态伙伴和开发者开放手机、PC和AI眼镜三类终端的服务接入,首批覆盖物流运输、房产居住、本地生活、理财、汽车等十多个领域。用户可在对话中@相关服务或点击"圆点角标"进入智能体,完成从咨询、推荐到下单的完整流程。平台支持标准化协议接入、一键授权与端到端调测,并提供账号、AI支付、订单接入等基础设施。
    https://mp.weixin.qq.com/s?__biz=MzYzNDE5MDEwMQ%3D%3D&mid=2247488345&idx=1&sn=ef4e57c9c9350f9238d90211eb2dd453

  3. Qwen-MM-Plugins 让智能体原生支持多模态 — X:通义千问 / Qwen (@Alibaba_Qwen)
    借助 Qwen-MM-Plugins,让智能体原生支持多模态——读取图片、视频和文档,编辑视频,处理 3D/CAD,以及更多。从多模态模型 → 多模态智能体。
    https://x.com/Alibaba_Qwen/status/2086664887560970531

  4. OpenChamber:一个基于代理的开发环境 — Hacker News 热门
    OpenChamber 是一个基于代理的开发环境,可跨桌面、浏览器、手机和 VS Code 使用,支持会话目标、多模型并行运行与融合、变更走查、从 issue 到 PR 的完整流程及定时任务。该工具基于 OpenCode SDK,完全开源且免费,代码和会话内容均保存在本地,远程访问可通过 UI 密码和端到端加密的 Private Relay 保护。
    https://openchamber.dev/

  5. Claude Code 自动模式默认开启原理 — X:Claude Devs (@ClaudeDevs)
    最近将自动模式设为 Claude Code 的默认选项,用户不再需要批准每一个操作。
    https://x.com/ClaudeDevs/status/2086844755770757531

  6. 我花了54个小时,做了一个可能更公平的AI大模型排行榜 — 公众号:数字生命卡兹克
    作者耗时54小时开发并免费开放了一个聚合多家可信榜单的AI大模型综合排行榜LatentRank。该榜单采用Bradley-Terry成对比较算法,并加入先验限制小样本结果,以解决不同榜单规模、领先幅度和模型缺失带来的评分偏差。目前榜单前五名中,Opus 5超过Fable 5位居前列。
    https://mp.weixin.qq.com/s?__biz=MzIyMzA5NjEyMA%3D%3D&mid=2647685059&idx=1&sn=a329fe9999ac2419470c7eca9a97acd3

  7. Omnigent 上下文策略如何阻断"致命三重奏"组合攻击 — Databricks:Blog
    Omnigent 的上下文策略(Contextual Policies)可阻断"致命三重奏"组合攻击——即多个看似无害的请求叠加后形成的恶意行为。该机制在单个请求层面不设防,而是在组合上下文中识别并拦截风险,从而在不牺牲正常功能的前提下提升安全性。
    https://www.databricks.com/blog/innocent-until-combined-blocking-lethal-trifecta-omnigent-contextual-policies

  8. Google 为 Google Ads 和 Google Analytics 推出新 AI 与智能体功能 — Google Blog:AI
    Google 宣布在 Google Ads 和 Google Analytics 中新增 AI 与智能体体验,包括 Google Analytics 首页的 AI Overviews 智能摘要、Google Ads 首页的 AI 洞察卡片,以及 Ask Advisor 新增的基准对比功能,可将广告效果与同类商家匿名平均值比较。这些功能基于 Gemini 构建,目前面向英文账户开放 beta 测试。
    https://blog.google/products/ads-commerce/google-ads-analytics-ai-updates

行业动态

  1. 英伟达联合六大机构融资5000亿美元建AI工厂 — X:Jensen Huang (@JensenHuang)
    英伟达宣布与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs和KKR合作,建立独立融资平台,动员超5000亿美元第三方资本支持AI基础设施建设。
    https://x.com/JensenHuang/status/2086934705207959965

  2. Zapier 如何用 ChatGPT Work 改造核心营销流程 — OpenAI:官网动态
    Zapier 企业营销团队用 ChatGPT Work 自动化线索漏斗优化、营销素材搭建和报告生成,每月可对数千条线索执行 QA/QC,单人查看一条流失线索原本需 35 至 45 分钟。该系统每月为销售团队带来七位数管道价值,并生成高管仪表盘展示线索管道中的重复问题与每周趋势。团队得以将更多时间投入策略与创意工作,并计划未来设置常驻自动化循环。
    https://openai.com/index/zapier

论文研究

  1. Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2% — Anthropic:Research
    Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。
    https://www.anthropic.com/research/riemann-zeta

技巧与观点

  1. tl;dv 逾18.1万段AI会议录音被公开暴露,可实时闯入他人通话 — Hacker News 热门
    AI会议记录平台tl;dv的Firestore数据库因缺乏租户隔离,任何已认证用户可查询全部18.1万段会议记录,涉及84,312名用户、35,003个域名,含23国政府及多所高校会议。处于录制状态的约1,000场会议会暴露可加入的会议ID,研究者借此闯入马来西亚教育部及美国某大学创业团队的实时通话。该漏洞自2026年1月报告后6个月仍未修复,另有超1,000段会议内容为公开状态。
    https://bobdahacker.com/blog/tldv-hack

  2. 智能体真的会用电脑吗?a16z 用数据给出答案 — a16z:News
    a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。
    https://www.a16z.news/p/can-agents-use-a-computer-yet-weve

  3. 扎克伯格:超级智能应人人可用 — X:Mark Zuckerberg (@finkd)
    每个人都应能使用超级智能,Meta 为所有人构建积极未来的理念与价值观。
    https://x.com/finkd/status/2086754845218726027

  4. Linear 如何构建 Linear Agent:在系统提示词、工具设计与系统技能中划定边界 — Linear:Now
    Linear Agent 的价值在于完成未预设的工作,因此团队未为其编写固定路径,而是通过系统提示词、工具设计、产品模型、运行范围及底层自定义 harness 划定边界。系统提示词聚焦沟通风格、硬性边界与产品概念解释;工具设计将约束编码进参数,使无效操作难以执行。团队还引入系统技能作为组合单元,按需渐进加载,避免一次性暴露过多上下文。
    https://linear.app/now/how-we-built-linear-agent

  5. Forking-Sequences:一种统计与计算上更高效的多步预测训练范式 — CMU:Machine Learning Blog
    CMU 研究团队正式定义并系统评测了 forking-sequences 训练范式:它无需新增参数,在一次前向传播中跨所有预测创建日期编码解码整条序列。
    https://blog.ml.cmu.edu/2026/08/10/forking-sequences-part-i-statistically-and-computationally-efficient-multi-horizon-forecasting

  6. 开源不等于开放权重:Gary Marcus 剖析两者本质差异 — Gary Marcus:The Road to AI We Can Trust
    开放权重模型并非真正的开源,二者在透明度和可定制性上存在根本区别。开源软件公开完整源代码,允许任何人查看、修改和分支;而开放权重模型仅发布训练后的神经网络权重,用户无法访问原始训练数据、预处理方法或训练算法,也不能自由修改或深入调查。这导致开发者、监管者和科学家在使用开放权重模型时面临诸多限制,Meta 最新发布的开放权重模型即为例证。
    https://garymarcus.substack.com/p/open-source-is-not-the-same-as-open


数据来自 aihot.virxact.com

精选工具

开发者工具

免费在线 JSON 格式化、验证和美化工具

使用我们的在线工具格式化、验证和美化您的 JSON 数据

Unix 时间戳转换器

轻松转换 Unix 时间戳和人类可读的日期格式

JSON Diff 工具

比较两个 JSON 对象之间的差异

文本差异对比工具

一个强大的在线文本差异对比工具,帮助您轻松比较两段文本之间的差异。

Meta 标签获取器

一个功能强大的 Chrome 扩展程序,用于实时提取、管理和自定义网页的 Meta 标签。

SQL 转表格工具

将 SQL 语句转换为可视化表格,支持 CREATE TABLE 和 INSERT INTO 语句

URL 元数据提取器

提取网页的标题、描述、图标和内容等元数据信息

JSON 验证和格式化工具

实时验证和格式化您的 JSON

Telegram Chat ID 查找器

使用机器人令牌轻松查找您的 Telegram chat ID

AI 文本隐形水印清洗器 & 零宽字符去除

检测并一键清除文本中隐藏的 AI 溯源水印、零宽空格、软连字符、Bidi 双向控制符与不可见 Unicode 标记 —— 100% 浏览器本地处理。

汇聚通义千问、百炼、TokenPlan、Qoder、万小智、秒悟等核心产品;覆盖文本、图像、代码、语音全场景能力。
秒悟 Meoo 新用户送 12000 积分,订阅套餐首月限量低至 9.9 元
搭建您的专属大模型主页