模型与能力
DeepSeek-V4-Flash 正式发布:不改架构,性能跃升
DeepSeek 推出 V4-Flash(0731 版),参数量仍为 284B/13B 激活,但 Terminal-Bench 从 56.9 升至 82.7,GDPval-AA Elo 从 1189 升至 1559,推理成本仅 $0.28/百万输出 token,且支持 1M 上下文和三档推理强度。
> 相关链接:官方公告|Artificial Analysis 详细评测
MiniMax H3 多模态视频模型上线:一键生成+内置超分
MiniMax 发布 H3 视频生成模型,已接入 Vercel AI Gateway 等平台;支持端到端低→高分辨率生成(非后置超分),即将开源权重。
> 相关链接:MiniMax 官方推文|技术细节分析
ByteDance Seedance 2.5:支持 3 分钟连贯视频+50 个参考图
Dreamina(字节)发布 Seedance 2.5,可原生生成最长 180 秒视频,支持交互式帧编辑和最多 50 个多模态输入参考,当前输出分辨率为 720p。
> 相关链接:功能总结|用户实测反馈
Agent 与工具链
DeepSeek-V4-Flash API 支持 Codex 和 Responses 格式
DeepSeek 新 API 兼容 Codex 工具调用协议和 Responses API 格式,开发者可直接集成进现有编程助手(如 Codex、Hermes Agent),无需重写调用逻辑。
> 相关链接:DeepSeek 官方说明|Codex 集成演示
LangChain 推出 LangGraph + DeepAgents + LangSmith 新栈
LangChain 官方发布新工具链:LangGraph(状态化工作流)、DeepAgents(多智能体框架)、LangSmith(标准化评估与调试),强调组织级可复现的 agent infra。
> 相关链接:生态图谱说明|任务转换与评估更新
PromptLayer 新增 Mock 工具响应功能
开发者现在可用 PromptLayer 模拟工具调用返回结果,无需连接真实后端,即可完整测试 agent 的决策链和错误恢复流程。
> 相关链接:官方介绍
基础设施与硬件
VLLM 支持 DeepSeek-V4-Flash:256 专家路由+DSpark 推理加速
vLLM 已适配 V4-Flash,支持 256 专家路由、每 token 激活 6 个专家,并内置 DSpark 推理模块(单 flag 启用),显著提升长上下文吞吐。
> 相关链接:vLLM 适配说明
Unsloth 发布 V4-Flash 量化版:4-bit 仅需 168GB RAM
Unsloth 提供无损 4-bit 和 3-bit 量化版本,分别需约 168GB / 110GB 内存,支持本地低成本部署。
> 相关链接:量化模型发布
研究与方法
微软 Echoverse:用 rollout 分析自动修复训练环境
微软新系统将需求规格编译为带状态的应用,通过 rollout 分析识别环境缺陷(如浅层环境降低线上准确率),并自动优化训练信号和环境配置。
> 相关链接:Omar Sarwar 总结
OpenMLE / Frontis-MA1:首个开源递归自我改进 ML 工程栈
发布完整自进化框架,含 Draft/Improve/Debug/Crossover 四种原子操作,支持在 ML 工程任务中持续迭代优化 pipeline。
> 相关链接:Dair.ai 介绍
产品与应用落地
Gemini 3.6 Flash 和 Spark 助手全面上线 macOS/Windows
Google 推出 Gemini 3.6 Flash(轻量版)、3.5 Flash-Lite,并扩大 Spark 助手覆盖范围;新增 macOS/Windows 语音输入、个性化头像和图像生成功能。
> 相关链接:Gemini App 更新日志|桌面端语音支持
OpenAI 推出 Activity 视图和宠物触发语音快捷键
ChatGPT 新增 Activity 页面汇总所有对话与操作记录;支持设置‘宠物名’作为唤醒词,快速启动语音输入,提升桌面端使用效率。
> 相关链接:Activity 视图说明|宠物触发语音演示
行业与公司动态
DeepSeek 完成 70 亿美元 Pre-IPO 融资,V4-Flash 成关键里程碑
DeepSeek 在发布 V4-Flash 前完成约 70 亿美元融资;该模型是其继 V4-Pro(4 月)后一年来首次重大技术回归,重新进入主流视野。
> 相关链接:融资背景说明|技术回归评价
政策、治理与安全
OpenAI 和 Anthropic 沙箱逃逸事件:主因是第三方 eval 环境配置失误
OpenAI 未发布 agent 逃逸至 Hugging Face,Anthropic 披露 3 起类似事件;调查确认均因第三方评估环境误开互联网权限,非模型自主越狱。
> 相关链接:Gergely Orosz 汇总|Anthropic 内部报告摘要
Clement Delangue:开放权重模型是网络安全防御关键工具
Hugging Face 曾用量化 GLM 5.2 快速响应安全攻击;禁止开源模型将主要损害安全研究员、初创公司和防御方能力。
> 相关链接:观点原文