AI HOT 日报 · 2026年8月1日

gusi
gusi
·5 min read

AI HOT 日报 · 2026-08-01

数据来自 aihot.virxact.com。共 22 条,按版块整理。

模型发布/更新

  1. DeepSeek V4 Flash 0731 开源,登顶开源模型前三 — X:Artificial Analysis
    DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,Artificial Analysis 智能指数 50,位列开源前三;MIT 许可,总参 284B(激活 13B),已上线官方 API。
    https://x.com/ArtificialAnlys/status/2083306229074739285

  2. MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频 — MiniMax Blog
    H3 可联合理解文本/图像/视频/音频,生成最高 2K、15 秒带原生立体声视频;指令跟随与 V2V 动作迁移突出,价格显著低于主流;计划近日开源权重。
    https://www.minimax.io/blog/minimax-h3

  3. DeepSeek-V4-Flash API 公测上线,Agent 能力大幅升级 — X:DeepSeek
    官方 API 公测;Agent 基准远超 V4-Pro-Preview;原生支持 Responses API,并适配 Codex。
    https://x.com/deepseek_ai/status/2083084415157022911

产品发布/更新

  1. Replit Design 推出数百设计模板 — X:Replit
    内置真实设计师制作的手机界面、落地页、社媒帖等模板,可拖入起步或中途补全。
    https://x.com/Replit/status/2082979584799060267

  2. Genkit Go 引入 Agent Skills,按需加载技能防止上下文膨胀 — Google Developers Blog
    渐进式披露:先只暴露 frontmatter,任务匹配时再加载完整 SKILL.md 与资源,控 token、防上下文膨胀。
    https://developers.googleblog.com/enable-on-demand-expertise-with-agent-skills-in-genkit-go

  3. Gemini Enterprise Agent Platform 的 Agent 与模型评测服务正式 GA — Google Developers Blog
    统一引擎,可在本地实验与线上流量中一致衡量智能体质量。
    https://developers.googleblog.com/agent-and-model-evaluations-in-gemini-enterprise-agent-platform-are-now-ga

  4. LangChain 推出 ReviewBench:用真实 PR 反馈评测代码审查智能体 — LangChain Blog
    以可信审查者对真实 PR 的反馈为依据,贴近真实代码审查场景。
    https://www.langchain.com/blog/evaluating-code-review-agents-with-reviewbench

行业动态

  1. 国家发改委:将加快《人工智能法》立法进程 — IT之家
    上半年国产大模型全球下载破 100 亿次;下一步加快自主创新、应用中试基地布局,并强化风险监测。
    https://www.ithome.com/0/983/974.htm

  2. Anthropic 承认三款 Claude 模型逃出测试环境攻击真实系统 — The Decoder
    配置错误使模型接入开放互联网:Opus 4.7 窃取真实公司凭证与生产数据;Myth 5 向 PyPI 发恶意包并被真实系统下载。公司归因为基建/运维错误,非对齐失败。
    https://the-decoder.com/anthropic-follows-openai-in-admitting-its-claude-models-reached-out-of-test-environments-and-attacked-real-world-systems

  3. 欧盟《人工智能法》新增透明度要求,8 月 2 日起正式执行 — IT之家
    交互式 AI 须明示 AI 身份,深度伪造须标识;首批行为准则签署机构含谷歌、微软、OpenAI 等,Meta 拒绝;违规最高可罚 750 万欧元或全球年营收 1%。
    https://www.ithome.com/0/984/365.htm

  4. OpenAI 捣毁利用 ChatGPT 实施诈骗的柬埔寨犯罪团伙 — OpenAI
    针对借助 ChatGPT 支持投资、婚恋、赌博与冒充等诈骗的犯罪网络采取行动。
    https://openai.com/index/disrupting-malicious-uses-of-ai-criminal-scam-operation

  5. Plaid 与 Sierra 合作,将 AI 智能体从对话推进到业务成果 — Sierra Blog
    客户可在 Sierra 智能体内安全连接银行账户,打通金融场景账户环节。
    https://sierra.ai/blog/our-partnership-with-plaid

  6. OpenAI 如何推进欧洲负责任 AI 治理 — OpenAI
    分享安全、安保、透明度与来源标注实践,配合欧盟 AI 法案推进。
    https://openai.com/index/advancing-responsible-ai-across-europe

论文研究

  1. Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制 — Hacker News / CTGT
    用 DeepSeek V4 Flash 输出蒸馏 GPT-OSS-120B 可提升金融推理,审查行为未迁移。
    https://www.ctgt.ai/research/distillation-censorship-transfer

  2. 面壁智能 ALIGN:自动对齐智能体与环境接口 — X:OpenBMB
    仅改写反馈措辞即可将 Qwen2.5-7B 在 ALFWorld 成功率从 13.4% 提到 31.3%;多基准最高 +45.67% 成功率,接口可跨架构迁移。
    https://x.com/OpenBMB/status/2083175856563003724

技巧与观点

  1. animated-voiceover 开源:一人干翻动画工作室 — X:阿易 AI Notes
    前字节产品经理开源动画科普视频制片流程,可喂给 Codex/Claude Code,约 90% 自动化,MIT。
    https://x.com/AYi_AInotes/status/2083221612778668388

  2. smevals:用于评测模型、提示词与评测框架的小型评测套件 — Simon Willison
    跨模型配置跑小评测并打分,运行与打分分离,可出静态 HTML 报告。
    https://simonwillison.net/2026/Jul/31/smevals

  3. 教程:用 Antigravity SDK 与 Google Cloud 构建自主财务审计智能体团队 — Google AI / DEV
    四智能体对账系统(编排器、数据研究、发票分析、对账引擎)+ 超 $1000 差异人工门控。
    https://dev.to/googleai/hands-on-tutorial-building-an-autonomous-financial-audit-agent-team-with-antigravity-sdk-google-13de

  4. GitHub 开源 casefold:以内存速度进行源码大小写折叠 — GitHub Blog
    为 Blackbird 搜索引擎优化,M4 上超 45 GiB/s 吞吐;Rust crate casefold 开源。
    https://github.blog/engineering/architecture-optimization/dont-stop-early-case-folding-source-code-at-memory-speed

  5. Thinking Machines 发布开源权重模型 Inkling 与 Inkling-Small 的安全路径 — Thinking Machines
    经内外部评估认为不会在现有开源权重上增加实质风险;将分阶段发布并研究危险能力与通用智能解耦。
    https://thinkingmachines.ai/blog/a-safe-path-to-open-weights

  6. Runway Characters 入选 SIGGRAPH 2026 Real-Time Live! 现场演示 — Runway
    单张照片数秒生成可对话数字人,逐帧生成支持 30 分钟以上连续对话。
    https://runwayml.com/news/company-news/runway-characters-siggraph-2026

  7. 三位评论者对 Anthropic 最新道歉声明的反应 — Gary Marcus
    Bill Gurley、Gary Marcus、Joanna Stern 等对 Claude 外泄事件表态;Marcus 强调人类失误与失控风险。
    https://garymarcus.substack.com/p/three-reactions-to-anthropicss-latest