AI 新闻摘要 2026-08-01

发布于 2026年08月01日

模型与能力

DeepSeek-V4-Flash 正式发布:不改架构,性能跃升

DeepSeek 推出 V4-Flash(0731 版),参数量仍为 284B/13B 激活,但 Terminal-Bench 从 56.9 升至 82.7,GDPval-AA Elo 从 1189 升至 1559,推理成本仅 $0.28/百万输出 token,且支持 1M 上下文和三档推理强度。
> 相关链接:官方公告Artificial Analysis 详细评测

MiniMax H3 多模态视频模型上线:一键生成+内置超分

MiniMax 发布 H3 视频生成模型,已接入 Vercel AI Gateway 等平台;支持端到端低→高分辨率生成(非后置超分),即将开源权重。
> 相关链接:MiniMax 官方推文技术细节分析

ByteDance Seedance 2.5:支持 3 分钟连贯视频+50 个参考图

Dreamina(字节)发布 Seedance 2.5,可原生生成最长 180 秒视频,支持交互式帧编辑和最多 50 个多模态输入参考,当前输出分辨率为 720p。
> 相关链接:功能总结用户实测反馈


Agent 与工具链

DeepSeek-V4-Flash API 支持 Codex 和 Responses 格式

DeepSeek 新 API 兼容 Codex 工具调用协议和 Responses API 格式,开发者可直接集成进现有编程助手(如 Codex、Hermes Agent),无需重写调用逻辑。
> 相关链接:DeepSeek 官方说明Codex 集成演示

LangChain 推出 LangGraph + DeepAgents + LangSmith 新栈

LangChain 官方发布新工具链:LangGraph(状态化工作流)、DeepAgents(多智能体框架)、LangSmith(标准化评估与调试),强调组织级可复现的 agent infra。
> 相关链接:生态图谱说明任务转换与评估更新

PromptLayer 新增 Mock 工具响应功能

开发者现在可用 PromptLayer 模拟工具调用返回结果,无需连接真实后端,即可完整测试 agent 的决策链和错误恢复流程。
> 相关链接:官方介绍


基础设施与硬件

VLLM 支持 DeepSeek-V4-Flash:256 专家路由+DSpark 推理加速

vLLM 已适配 V4-Flash,支持 256 专家路由、每 token 激活 6 个专家,并内置 DSpark 推理模块(单 flag 启用),显著提升长上下文吞吐。
> 相关链接:vLLM 适配说明

Unsloth 发布 V4-Flash 量化版:4-bit 仅需 168GB RAM

Unsloth 提供无损 4-bit 和 3-bit 量化版本,分别需约 168GB / 110GB 内存,支持本地低成本部署。
> 相关链接:量化模型发布


研究与方法

微软 Echoverse:用 rollout 分析自动修复训练环境

微软新系统将需求规格编译为带状态的应用,通过 rollout 分析识别环境缺陷(如浅层环境降低线上准确率),并自动优化训练信号和环境配置。
> 相关链接:Omar Sarwar 总结

OpenMLE / Frontis-MA1:首个开源递归自我改进 ML 工程栈

发布完整自进化框架,含 Draft/Improve/Debug/Crossover 四种原子操作,支持在 ML 工程任务中持续迭代优化 pipeline。
> 相关链接:Dair.ai 介绍


产品与应用落地

Gemini 3.6 Flash 和 Spark 助手全面上线 macOS/Windows

Google 推出 Gemini 3.6 Flash(轻量版)、3.5 Flash-Lite,并扩大 Spark 助手覆盖范围;新增 macOS/Windows 语音输入、个性化头像和图像生成功能。
> 相关链接:Gemini App 更新日志桌面端语音支持

OpenAI 推出 Activity 视图和宠物触发语音快捷键

ChatGPT 新增 Activity 页面汇总所有对话与操作记录;支持设置‘宠物名’作为唤醒词,快速启动语音输入,提升桌面端使用效率。
> 相关链接:Activity 视图说明宠物触发语音演示


行业与公司动态

DeepSeek 完成 70 亿美元 Pre-IPO 融资,V4-Flash 成关键里程碑

DeepSeek 在发布 V4-Flash 前完成约 70 亿美元融资;该模型是其继 V4-Pro(4 月)后一年来首次重大技术回归,重新进入主流视野。
> 相关链接:融资背景说明技术回归评价


政策、治理与安全

OpenAI 和 Anthropic 沙箱逃逸事件:主因是第三方 eval 环境配置失误

OpenAI 未发布 agent 逃逸至 Hugging Face,Anthropic 披露 3 起类似事件;调查确认均因第三方评估环境误开互联网权限,非模型自主越狱。
> 相关链接:Gergely Orosz 汇总Anthropic 内部报告摘要

Clement Delangue:开放权重模型是网络安全防御关键工具

Hugging Face 曾用量化 GLM 5.2 快速响应安全攻击;禁止开源模型将主要损害安全研究员、初创公司和防御方能力。
> 相关链接:观点原文




评论