DeepSeek 一天三连:V4 Pro 正式版发布遇事故、Harness 开源、API 全面涨价;Gemini 3.7 Flash 半价登场
8 月 13 日(PT)是 2026 年以来模型发布最密集的一天之一。DeepSeek 在同一窗口内完成三件事:V4 Pro 正式版上线(随后被社区发现部署异常、疑似回滚后重发)、开源 agent 运行时 DeepSeek Harness v0.1、并宣布 API 全面涨价;Google DeepMind 发布半价的 Gemini 3.7 Flash;…
8 月 13 日(PT)是 2026 年以来模型发布最密集的一天之一。DeepSeek 在同一窗口内完成三件事:V4 Pro 正式版上线(随后被社区发现部署异常、疑似回滚后重发)、开源 agent 运行时 DeepSeek Harness v0.1、并宣布 API 全面涨价;Google DeepMind 发布半价的 Gemini 3.7 Flash;OpenAI 端出 GPT-5.6 的 Ultrafast 极速模式和一位新 CRO;xAI 的 Grok 4.6 与 Grok Bot 也在同一时间线内扩散。主线是 agent 竞争从“模型能力”扩展到“运行时 + 成本”的完整维度,而 DeepSeek 的发布事故提醒:模型炼得出来,发布环节同样会出错。
主题一:DeepSeek V4 Pro 0813 正式版:上线、回滚、重发
DeepSeek 于北京时间 8 月 13 日晚在 APP、网页端和 API 同步上线 V4 Pro 正式版(模型名 deepseek-v4-pro),官方公布的 Agent 成绩包括 HLE(wo/w tools)42.7/60.0、Terminal Bench 2.1 为 87.9、Cybergym 83.3、DeepSWE 从预览版 12.8 提升至 62.7、全栈开发基准 71.1,并声称“性能超过 Opus 4.8、接近 Fable 5”。官方还强调原生支持 OpenAI Responses API,社区称“一键把 Codex 后端换成 DeepSeek 不用改代码”。
但社区实测与官方宣传出现明显落差。多位用户反馈 0813 上线后复杂任务思考时间“短得离谱、基本不超过 10 秒”,凌晨疑似紧急回滚;DeepSeek 官网一度撤下正式版发布通知,被社区称为“可能是 DeepSeek 第一次发布失败”。随后 API 返回的模型指纹从可读格式(如 fp_v4pro_20260812_prod0820_fp8_kvcache)突然变成纯 32 位哈希,且 Pro 与 Flash 同时切换,指向线上推理栈的一次明确变更。最戏剧性的是社区在 Hugging Face 上发现:上传的 V4-Pro-0813 仓库 config 与 V4 Flash 一致(hidden_size 4096、43 层、256 个 routed experts、64 个 attention heads,而 Pro 应为 7168、61 层、384 experts、128 heads),仓库一度下架,重传后不仅 config 改回,部分 safetensors 权重的 SHA256 与文件大小也发生变化。
证据边界:官方 benchmark 为厂商自测;发布事故、回滚与权重变更均为社区观察(MaxForAI、karminski-牙医等),DeepSeek 官方未公开解释。若“发错模型”成立,这更像部署与发布环节的问题,而非模型本身能力归零。
同日 DeepSeek 宣布 API 全面涨价:8 月 17 日零点起实行峰谷双价,缓存命中输入价最高涨 12 倍、输出涨约 4.5 倍,非高峰输出约 $1.98/百万 token、高峰约 $3.96。即便涨价,其价格仍显著低于 Fable 5($10 输入 / $50 输出),社区共识是“涨完仍是同级别最便宜”。社区对正式版的详细解读还提到:Terminal Bench 87.9 只比最贵的 Fable 5 低 0.1,Cybergym 83.3 与 Fable 5 打平,DeepSWE 从预览版 12.8 干到 62.7,且原生支持 OpenAI Responses API、为 Codex 做了专门优化;模型新增三档推理强度(简单任务 low、日常 agent high、复杂任务 max),把推理预算与价格直接挂钩。官方还披露了内部自建基准 DSBench-FullStack / DSBench-Hard:FullStack 排序为 Fable 5(77.2)> Kimi K3(73.7)> Opus 4.8(71.6)> V4 Pro 0813(71.1),Hard 则为 Opus 4.8(71.7)> Fable 5(68.3)> V4 Pro(67.2)> Kimi K3(63.0)——在 DeepSeek 自己定义的高难 agent 任务里,Opus 4.8 反超更新的 Fable 5。该基准尚未公开题目与数据分布,结论需谨慎。
发布事故之后,社区验证仍在进行:有测评者称已烧掉约 1 亿 token 排查 V4 Pro 0813 的问题所在,并预告发布评测与硬核解析视频;也有用户对比 Pi + V4 Pro 与 Claude Code / Codex / Gemini / Grok 的手感差异。这些属于单帖实测,不能当作对模型能力的定论,但“官方发布版本与社区体验不一致”本身已构成当天的重要信号。
源链接:
- https://api-docs.deepseek.com/zh-cn/updates
- https://x.com/MaxForAI/status/2087812650625622468
- https://x.com/MaxForAI/status/2088030537256726855
主题二:DeepSeek Harness v0.1:把 agent 运行时整个开源
DeepSeek Harness(DSH)v0.1 于北京时间 8 月 13 日晚发布开发者预览版,MIT 许可,基于 Cordis 元框架,核心设计是“一切皆插件”:模型、工具、技能、会话、沙箱、文件系统、循环、编排乃至 UI 均可自由组合与替换。发布后数小时内 GitHub stars 从 2.4 万冲到 3 万以上,社区称其为“agent 时代的 emacs / foobar2000”。
从泄漏的系统提示词和社区代码阅读看,DSH 不是又一个聊天框:它定义了几套执行模式——标准模式(写代码、改仓库)、PTC 模式(Programmatic Tool Calling,用 TypeScript 一次组合多步工具调用,五次往返收成一次)、极简模式(只留持久 bash 和按绝对路径改文件的 str_replace_editor)、创造模式(在活的运行时上执行模型写的 JavaScript,自定义 agent 预设)。运行时层面包含 KV 缓存感知设计(不修改历史前缀、变更末尾追加)、长任务 Goal 状态、session resume/fork 后 Goal 需重新 rearm、以及“Ralph Loop”——每轮创建一个完全失忆的新 agent,只通过共享 Workspace 保留长期记忆。Session 采用 Event Sourcing,追加日志为准、状态为投影。默认由 deepseek-v4-flash 驱动。
社区评价两极。支持方称“把内部训模型、跑生产用的 harness 全放出来,这才是真开源”;反对派则认为对日常写代码的开发者“重得毫无必要”,并反馈并行复杂任务时前端易卡死、API 404 等体验问题。还有开发者把 DSH 比作“agent 时代的 emacs”(Pi 是 vim),玉伯称其让人想起 foobar2000——一个高度可组合、靠社区插件生态生长的软件形态。发布后当天已出现 DSH 桌面版、搜索插件(dsh-find-plugin)、插件精选列表(awesome-dsh-plugin)与 Tokei 的 Day-0 支持,插件生态的启动速度相当快。
证据边界:系统提示词与架构分析来自社区阅读,论文含大量范畴论符号但工程判断存在分歧。这件事的意义在于:开源 agent 运行时成为新的竞争焦点,“模型 × Harness 才是完整 agent 能力”的判断正在被更多实验室接受。
源链接:
- https://x.com/deepseek_ai/status/2087887408440164663
- https://x.com/MaxForAI/status/2087911172859458020
- https://x.com/AYi_AInotes/status/2087962866355995054
主题三:Gemini 3.7 Flash:三周迭代、价格减半
Google DeepMind 发布 Gemini 3.7 Flash,距离 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出定价为每百万 token $0.75 / $3.75,是原 3.6 Flash 的一半;Google 侧称 introductory price 持续到年底,OpenRouter 渠道半价到 8 月 27 日。模型支持 1M context、reasoning、tool calling、多步规划与多模态,Cline 等工具当天接入。DeepMind CEO Hassabis 与多位研究者密集背书“闪电般快”。
社区评价:与 Grok 4.6、DeepSeek V4 Pro 同日发布相比,Gemini 的声量“安静得可怜”,但 GA 版本对生产用户价值明确——此前 Preview 的并发与稳定性是主要痛点;Cline 官方称“基准结果接近前沿水平”(该说法需以官方基准为准),有研究者提到其 PDF 理解能力明显增强,社区注意到模型卡上甚至出现了 PDF 演示;同时有观察者质疑 Gemini 3.5 Pro 是否被跳过(“直接奔 4.0 训练去了”),这一点尚无官方确认。意义在于 Flash 系列的发布节奏(3 周一代)叠加半价,把编码与 agent 工作的单位成本继续压低,与 DeepSeek 的涨价形成方向对比。
源链接:
- https://deepmind.google/blog/introducing-gemini-3-7-flash
- https://x.com/GoogleCloudTech/status/2087952104157564976
- https://x.com/cline/status/2087965835164090580
主题四:OpenAI:GPT-5.6 Ultrafast 极速模式与商业化高层更替
OpenAI 发布 GPT-5.6 构建者指南和 Ultrafast 服务层:同一 Sol 模型在 Ultrafast 下比 Standard 最高快 14 倍、输出速度最高 750 tokens/s,由 Cerebras 提供算力,目前 Limited Preview,Jane Street、Podium、Basis、Rogo 等已在测试;相比之下,7 月底刚推出的 Fast Mode 只有 2.5 倍速度、2 倍价格。官方给出的应用场景集中在实时语音、故障响应、金融研究、客服等对延迟敏感的 agent 场景。构建者指南还披露:启用保留推理和压缩后,Sol 在 ARC-AGI-3 上从 13.3% 跃升至 38.3%,输出 token 减少约 6 倍;Luna 在 BrowseComp 上以 84.04% 追平 GPT-5.5(84.36%),单次成本从 $33.27 降至 $1.33;新增推理持久化、原生多智能体编排与程序化工具调用等 API 能力。
商业化层面,OpenAI 一周内连失两名高管:8 月 11 日 COO Brad Lightcap 离职,8 月 13 日 CRO Denise Dresser 离职(加入仅 8 个月,5 月还公开称企业客户贡献 40% 收入、预计年底 50%);继任者 Dali Rajic 来自 Google 旗下 Wiz(此前任 President/COO),同时有报道称 Greg Brockman 正在重新加强对日常运营的影响力。证据边界:人事信息来自 WSJ/Axios 转述(社区单源),OpenAI 官方仅确认任命。在 IPO 与组织重构并行的节点上,商业化最高层连续换人值得关注。
源链接:
- https://openai.com/index/builders-guide-to-gpt-5-6
- https://openai.com/index/previewing-ultrafast
- https://openai.com/index/dali-rajic-chief-revenue-officer
主题五:Grok 4.6 与 Grok Bot:xAI 的 agent 双线推进
SpaceXAI 与 Cursor 合作推出 Grok Bot,一个可连续操作应用与网站、完成后返回结果的通用 agent:能研究线索、更新 CRM、处理发票、复现 bug、在用户电脑关闭时继续跑已学习的工作流,beta 面向 SuperGrok Heavy 与 Cursor 订阅者,团队席位 $120/月起、个人 $200/月。同一天 Grok 4.6 扩散:Perplexity CEO Aravind Srinivas 称在其 Wide-And-Deep-Research 基准上用 Perplexity Computer harness 评测,Grok 4.6“干净地落在性能/成本 Pareto 前沿”;Warp 当天接入;多位实测者评价“智能接近 GPT-5.6 Sol、接近 Opus 5/Fable 5,但更快更便宜”。埃隆·马斯克还放风 Grok 4.7 将在约一个月内发布,并称其真实工程能力“如果被超越会很惊讶”(厂商/创始人自述,需标注)。
社区围绕“谁更划算”出现直接对照:一方称 Grok 4.6 在“每次成功成本”上领先 V4 Pro,另一方称 V4 Pro 同提示词下比 Grok 4.6 快一倍。这些多为单次实测,不构成普遍结论。意义:xAI 在模型、订阅与 agent 产品三条线上同时加码,与 Cursor 的合作把 Grok 直接送进最活跃的编码 agent 用户群。
源链接:
- https://x.com/rileybrown/status/2087943367703323072
- https://x.com/AravSrinivas/status/2087973972642234461
- https://x.com/warpdotdev/status/2087935553790410954
主题六:X 开源“For You”推荐算法并推出“限流”自查工具
X 将“For You”页面的推荐算法开源,并同步推出一个自查工具:用户可查看上个月自己的账号或单条帖子是否被打上“限制可见性(Limiting Labels)“标签,还能把数据下载下来自行分析。功能目前是试点:随机抽取部分账号,注册满 1 年且上月发帖不少于 10 次。社区对开源内容的权重解读:预测引用权重 5×、预测关注 4×,通过 DM 或复制链接分享有额外奖励;重复文本会被标记为 COPYPASTA_SPAM;“不感兴趣”、拉黑、静音与举报对分数有负向影响,其中举报权重最强;点赞贡献的 SimClusters 发现分有 8 小时半衰期;账号信誉 UserCredV2 更接近信任/权威度量,关注质量比数量更重要。
意义:把内容分发的“明牌”公开,既是一次透明化尝试,也让创作者第一次能系统性地看到限流判定。需要说明的是,公开的权重数值用于预测事件,不代表每次互动都会精确加减分。
源链接:
主题七:开源模型三连:Qwen3.8-2.4T-A95B、MiniMax Music 3.0、小红书 dots.tts
阿里开源 Qwen3.8-2.4T-A95B:2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行,硅基流动提供 Day-0 支持,API 定价输入 $2.00、输出 $6.00、缓存输入 $0.25(每百万 token)。
MiniMax 发布 Music 3.0:开源权重、定位“生产级”的全能音乐生成模型,输入创意概念和可选歌词即可一次性完成作曲、编曲、演奏与制作,最长支持五分钟,已在 ComfyUI 本地运行,官方称“开源到 AGI 到来为止”。同日 MiniMax H3 宣称登顶 Video Edit Arena(官方自测,注意证据边界)。
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,官方称在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度(厂商自测)。
三件事的共同点:开源权重正在覆盖音乐、语音等此前以闭源为主的模态,且“开源 + Day-0 推理平台支持”成为标配。此外社区还在实测 MiniMax H3 的本地部署(双 4090 记录)与 Seedance 2.5 的视频微表情对比,属于单帖体验,不构成基准结论。
源链接:
- https://x.com/SiliconFlowAI/status/2087903227224412222
- https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model
- https://mp.weixin.qq.com/s?__biz=Mzg4OTc2MzczNg%3D%3D&mid=2247496062&idx=1&sn=d4c48926c5d7607f129dfea03699a6c0
主题八:agent 研究信号:水印、skill 代价与记忆基准
Anthropic 为 Claude 文本加入不可感知的机器可读水印(8 月 2 日及以后发布的模型生效),覆盖 chatbot、API 与 Claude Code,图像端有类似系统,官方口径是满足欧盟 AI 法案透明度要求;X 上出现“因水印取消 Claude 订阅”的讨论,属个别用户行为观察,不代表普遍趋势。
两份 agent 相关论文在同日被广泛转述。其一是微软与同行的工作:把 307 次 agent 失败归因于已加载的 skills(125 次功能性失败、182 次效率回退),发现“看似相关的 skills 反而推动 agent 错误实现或遗漏任务要求”,成本回退的最大来源是过度验证(67 例)与重型实现管道(30 例),且与提示长度无关——skills 会把验证清单悄悄变成强制性工作。
其二是 Harness-IF:逐条评估 256 条 AGENTS.md 规则,在 12 个前沿模型上 raw accuracy 为 72.1%–85.9%,剥离“模型本来就会这么做”的巧合后(Against-Prior)降至 66.1%–78.6%,所有模型都下降 3.6–7.4 个点;优先级不随提示深度排列——系统提示、项目文件与用户指令的优先级高于工具与技能描述。此外,UC San Diego 团队构建的 agent 记忆基准把记忆拆成四项能力(准确检索、测试时学习、长程保持、选择性遗忘),所有被测系统(纯上下文、RAG、外部记忆模块)至少有一项不达标,“多数系统对检索很强、对遗忘避而不谈”。
这些研究合起来指向同一个工程教训:agent 的能力不仅取决于模型,还取决于加载了什么规则、技能与记忆机制——加得越多不一定越强。
源链接:
- https://www.theaivalley.com/p/anthropic-introduces-invisible-watermarks
- https://x.com/omarsar0/status/2087926158432309306
- https://x.com/omarsar0/status/2087962456572498142
高价值单点
- Google Sheets canvas:用自然语言提示词把表格数据变成交互式仪表盘、学习追踪器等“迷你应用”,基于 Gemini 构建(https://blog.google/products-and-platforms/products/workspace/sheets-canvas-for-google-sheets-spreadsheets)。
- Cursor builds 与 Firetiger 收购:builds 在后台持续准备开发环境副本,云 agent 启动最快提升 3 倍,8 月 17 日起默认启用;同日宣布吸纳 Firetiger 团队,目标是“让 agent 跟随工作进入生产、修复出问题的地方”(https://cursor.com/blog/builds)。
- Boris Cherny 的 Claude 维护实验:让 Claude 通过 Slack 频道接管应用日常维护(崩溃模糊测试、重复代码统一、死代码移除等),数周开出 388 个 PR、合并 180 个,多数一次改对(https://x.com/bcherny/status/2088014489438621990)。
- Meta 多模态核心研究员 Jiahui Yu 离职创业:履历覆盖 Gemini 首代多模态、GPT-4o/o3/o4-mini 与 Meta Muse 系列,新公司信息未公开(https://x.com/MaxForAI/status/2088001225539395740)。
- 标普 500 首次触及 7800 点:AI 龙头领涨、PPI 低于预期支撑“软着陆”叙事;社区同时提示 Shiller 周期市盈率已到 41–42(历史均值约 17、2000 年峰值 44),属市场情绪信号而非 AI 行业事实(https://x.com/AYi_AInotes/status/2087928509154955452)。
- Gemma 家族下载量破 10 亿:Google Cloud 转述(https://x.com/GoogleCloudTech/status/2087930516687200632)。
- 微信被曝发布大语言模型 WeLM 系列:80B(A3B)与 617B(A23B),仅在 X 上独家发布,细节极少、单源待确认(https://x.com/shao__meng/status/2087876422241263649)。
- DeepSeek 相关:K3 遭“前所未有的蒸馏攻击”说法:社区转述称 Kimi K3 发布后遭遇批量蒸馏攻击,攻击者利用 Kimi Code 的漏洞创建免费账号获取 K3 输出;单源说法、未获 Kimi 官方确认,仅作线索记录(https://x.com/MaxForAI/status/2087840463592260073)。
- Stanford 的 nanochat SWE-bench 速刷:$60 训练算力跑出 5.0% pass@1,约等于 2023 年 Claude 2 的水平,作为“小模型低成本逼近旧 SOTA”的参考案例(https://x.com/rdolmedo_/status/2087962560511537464)。
- TMLR 停收综述论文:TMLR 宣布自 2026 年 9 月 1 日起不再考虑综述论文,理由是审稿资源有限;对 AI 论文发表生态是直接信号(https://x.com/hugo_larochelle/status/2087952442658881826)。
- Chrome DevTools for agents:让环境自动发现并修复失败的 Lighthouse 校验等 broken code,形成闭环(https://x.com/ChromiumDev/status/2088016353361854893)。
- Databricks 宣布 $7B 收入 run-rate、Q2 同比增长超 80%:企业数据平台采用信号(https://x.com/alighodsi/status/2087919945933853173)。
- Claude Code 桌面版新增 auto-continue:用量限制恢复后自动继续任务(https://x.com/ClaudeDevs/status/2088014831605702937)。
🕐 小时信号精选
| PT 时间 | 信号 | 为什么值得记住 |
|---|---|---|
| 00:00 | DeepSeek V4 Pro 0813 上线后社区实测不佳,复杂任务思考时间异常短 | 发布事故的第一波现场证据 |
| 01:00 | DeepSeek 官网撤下 V4 Pro 0813 发布通知 | “首次发布失败”讨论升温 |
| 03:00 | 内部基准 DSBench 被挖出,Hard 档 Opus 4.8 反超 Fable 5 | 自建基准暴露实验室优化方向 |
| 04:00 | DeepSeek 涨价图传开:缓存命中输入价最高涨 12 倍 | 价格体系从“地板价”转向峰谷定价 |
| 05:00 | API 指纹从可读格式变为 32 位哈希,Pro/Flash 同时切换 | 线上推理栈切换的间接证据 |
| 07:00 | DeepSeek Harness 开源,数小时破 2.4 万 stars | 开源 agent 运行时成为当天第二主线 |
| 08:00 | DSH 破 3 万 stars;标普 500 首触 7800 | 热度与市场情绪同频 |
| 09:00 | Gemini 3.7 Flash 正式发布,Cline 当天接入 | 半价工作模型加入价格战 |
| 10:00 | OpenAI CRO Denise Dresser 离职消息传开(WSJ 报道) | 商业化高层连续更替 |
| 11:00 | Hugging Face 上 V4-Pro-0813 的 config 与 Flash 一致被确认,仓库下架重传 | 发错模型的实锤线索 |
| 12:00 | X 开源 For You 算法并推出限流自查工具 | 内容分发规则首次可验证 |
| 13:00 | Claude 桌面版新增 auto-continue 复选框 | agent 长任务体验的小改进 |
编辑结论
这一天最实质的变化不是某个模型的分数,而是 agent 竞争的坐标系变了:DeepSeek 用“正式版 + Harness + 涨价”三连击,把“模型能力、运行时可替换性、单次调用成本”摆到同一张桌上讨论,虽然发布过程出了事故,但开源 Harness 与新的价格体系都是长期影响大于单日波动的动作;Google、OpenAI、xAI 在同一天各自出牌,方向一致——围绕编码与 agent 场景,拼模型、拼运行时、拼每成功成本。对开发者而言,今天值得记住两件事:agent 表现是“模型 × Harness × 你加载的规则”共同作用的结果,以及便宜和快正在成为比榜单分数更硬的竞争维度。
来源与方法
审阅 30 个原始抓取文件(20 个小时快照 + 10 个命名来源),其中 5 个命名来源有实质内容,另有 4 个小时快照缺失(06/20/21/22 点)。主要事件均有跨源或强单源支撑;厂商自测基准、社区单帖实测与人事转述已在相应位置标注证据边界。信号池:rich。
