AI 新闻摘要 2026-08-07

发布于 2026年08月07日

模型与能力

Meta Muse Spark 1.2:价格仅 $0.69/次,比 Kimi 便宜 3 倍、比 Opus 便宜 10 倍

Muse Spark 1.2 在 Vals Index 进入榜单前 5,Finance Agent v2 测试中达 60%+ 准确率($0.77/次),而此前第一的 Opus 5 要 $5.12/次;Meta 还称其在 5 个 STEM 奥赛中取得金牌级成绩(无搜索/计算器/代码工具)。
> 相关链接:Vals Index 排名奥赛成绩详情

OpenAI 统一 ChatGPT 模型:GPT-5.6 Sol 同时服务‘即时’和‘深度思考’

Plus/Pro 用户现在统一用 GPT-5.6 Sol,新增滑块调节推理强度;实测在金融/医疗/法律高风险评测中,事实错误减少 68%;免费和 Go 用户则获无限 GPT-5.6 Luna 文本聊天 + ‘Think’ 按钮。
> 相关链接:官方公告错误率对比数据

Qwen 3.8-Max 开放在即:2.4T 参数 MoE 模型,下周三正式发布

Qwen 官方确认 Qwen3.8-2.4T-A95B(即 Qwen3.8-Max)将于下周三在 ModelScope 公开,是首个开源的 Qwen-Max 级模型;同期还将推出 Qwen3.8-27B 等轻量版本,主打本地部署和编程场景。
> 相关链接:ModelScope 预告页AMA 技术说明

ARC Prize 测评:GPT-5.6 Luna 降价 80% 后能力未降

GPT-5.6 Luna 经 80% 降价后,在 ARC-AGI-2 达 59.6%($0.18/任务),ARC-AGI-1 达 90.7%($0.07/任务),证明低价模型也能维持强泛化能力。
> 相关链接:ARC Prize 报告


Agent 与工具链

OpenAI 推出 Agent Plugins:首个跨平台 Agent 技能打包标准

联合 AWS、Cursor、GitHub、Vercel 等推出开放标准,支持将 Agent 技能与 MCP 服务配置打包;已接入 Codex、ChatGPT、Cursor、GitHub Copilot、Kiro 等全部主流客户端。
> 相关链接:OpenAI Devs 公告

Cloudflare 发布 Kitesurf:Worker 上无状态浏览器,专为 Agent 设计

把 DOM/脚本和渲染分离,按需启动渲染 Worker,大幅降低 CPU/内存开销;同时升级 WebMCP、AI Search 和 MCP 核心,使其适配通用 Web 基础设施。
> 相关链接:技术介绍

Weaviate 内置 MCP 支持:无需单独服务,直接启用 /v1/mcp 接口

Weaviate 新版原生集成 MCP,同一端口提供 collection 检查、租户列表、混合搜索、对象写入等功能,RBAC 权限可独立开关读写权限。
> 相关链接:Weaviate 官方说明

Prime Agent 开源:声称在 ARC-AGI-3 达 95.5%,超人类基线

开源编码/研究 Agent 框架,支持多智能体通信、持久化执行环境和自修改 harness;但社区质疑其 benchmark 设计合理性,呼吁与 Cline、Droid 等强基线对比。
> 相关链接:项目主页


基础设施与硬件

Unsloth 推出 DSpark:DeepSeek-V4-Flash 本地推理提速 1.4–2 倍

无需精度损失,GGUF 格式下 DeepSeek-V4-Flash-0731 可达 120 token/s;适合 RTX 5090 等消费级显卡本地部署。
> 相关链接:Unsloth 公告

vLLM 加速 Kimi K3 开源部署:发布验证版 serving 配方

vLLM 官方推出经验证的 Kimi K3 部署方案,并强调已支持 50 万+ GPU 规模的 open-model 生产级推理基础设施。
> 相关链接:vLLM GitHub


研究与方法

Google DeepMind 发布 WeatherNext 2:热带气旋预报多抢 1 天预警时间

Nature 论文成果,开源代码与权重;实测对飓风 Melissa 提前 5 天以 80% 置信度预测五级登陆,相当于十年气象 AI 进展。
> 相关链接:Nature 论文

Elicit 推出 BioDecisionBench:专注药物研发决策中的推理陷阱识别

基于 26 个真实生命科学失败案例构建,测试模型能否发现混杂因素、替代终点误用等关键错误,而非泛化问答能力。
> 相关链接:Elicit 博客

Reka 发布 RekaDaily-10k:10,312 小时真实家庭第一视角视频数据集

覆盖美、拉美、亚、非四地,含 ~1670 小时原生 4K 视频,Apache 2.0 开源,目标是让物理 AI 学会处理‘真实世界的混乱’而非合成数据。
> 相关链接:Reka 官方发布


产品与应用落地

Qwen3-TTS 正式进入 llama.cpp 主线:支持本地多语种语音克隆

Qwen3-TTS-12Hz-1.7B-Base GGUF 已合并进 llama.cpp,支持从 WAV/MP3 参考音频克隆声音;RTX 5090 上实测达 7.5–8.6 倍实时速度。
> 相关链接:llama.cpp PR

GitHub Copilot 开始试用 Kimi K3:Fireworks 托管,定价 $3/1M 输入、$15/1M 输出

Copilot 新增 Kimi K3 作为可选模型(Fireworks 托管),但因 GitHub Actions 故障临时暂停;明确公布每百万 token 成本,方便开发者成本估算。
> 相关链接:GitHub 官方说明


行业与公司动态

AMD 宣布收购 Taalas:押注定制 ASIC 用于 AI 推理

AMD 收购初创公司 Taalas,强化其在 AI 推理专用芯片领域布局;此前 Latent Space 多次撰文指出 Taalas 是值得关注的定制 ASIC 方向代表。
> 相关链接:Latent Space 原文

Cursor 推出智能 Router:按任务类型自动路由至 Grok 4.5 / GPT-5.6 Sol / Opus 5 等最优模型

基于每周数百万次用户交互训练,Router 能识别 Routine / Planning / Execution / Debugging 等任务类型,分别调用不同模型以兼顾速度与效果。
> 相关链接:Cursor 官方说明


政策、治理与安全

白宫新规:美国本土开源模型免于政府强制安全审查

仅对闭源、具备顶尖网络攻防能力的美国模型要求上市前提交政府测试;Qwen、DeepSeek 等中国开源模型因属境外发行,实际不受该政策约束。
> 相关链接:WSJ 报道

MiniMax 对 Hugging Face LoRA 上传者发警告:限制‘去审查’类衍生模型分发

MiniMax 以违反模型许可为由,要求下架 Hugging Face 上部分 H3 LoRA;社区讨论焦点转向‘开放权重’不等于‘真正开源’,许可证是否允许自由衍生仍是关键分歧。
> 相关链接:Reddit 讨论截图




评论