每日编辑摘要

№ 20260812

DeepSeek V4 Pro 与 Grok 4.6 同日发布,阿里 Meta 相继开源旗舰权重

PT 8 月 12 日是近期模型发布最密集的一天:DeepSeek V4 Pro 正式版(V4-Pro-0813)与 Grok 4.6 在约两小时内先后上线,且都定位为对上一代的同价或低价升级;阿里首次开放 Qwen-Max 级别权重 Qwen3.8-2.4T-A95B,Meta 超级智能实验室的首个开放权重模型 Muse Glimmer 也登上 Op…

PT 8 月 12 日是近期模型发布最密集的一天:DeepSeek V4 Pro 正式版(V4-Pro-0813)与 Grok 4.6 在约两小时内先后上线,且都定位为对上一代的同价或低价升级;阿里首次开放 Qwen-Max 级别权重 Qwen3.8-2.4T-A95B,Meta 超级智能实验室的首个开放权重模型 Muse Glimmer 也登上 OpenRouter。除此之外,微软宣布自研推理模型 MAI-Thinking-1,微信官宣自家 WeLM 模型;xAI 与 Cursor 合作的云端 Agent Grok Bot 进入 beta。当天的大多数数字来自厂商自述、第三方聚合榜或开发者单帖,价格、基准和“即将发布”的传闻需要分别看待。

主题一:DeepSeek V4 Pro 正式版静默上线,价格约为 Flash 三倍

发生了什么。DeepSeek-V4-Pro-0813 在 PT 8 月 12 日晚间发布,与 Grok 4.6 相隔约两小时。与往常不同,官方 X 账号没有高调官宣,信息主要通过开发者社区扩散,社区用“静默发布”形容这次节奏。同一窗口内,DeepSeek Harness(DSH)“今日开启公测”的截图在流传,但尚未得到官方确认。

关键证据。按开发者整理的价格表,V4 Pro 每百万 token 输入(缓存命中)0.025 元、输入(缓存未命中)3 元、输出 6 元,而 V4 Flash 对应为 0.02 元、1 元、2 元——在缓存未命中输入和输出两个主要计费项上,Pro 约为 Flash 的 3 倍;并发上限 500,低于 Flash 的 2500。功能上,Pro 不支持图片和文件输入(image 内容块会被替换为占位文本),即没有视觉能力。第三方测试方面,cline 团队公布 Terminal-Bench 2.1 得分 87.9,称仅比 Claude Fable 5 低 0.1 分、屈居第二,且价格便宜约 57 倍;该数字来自 cline 团队自测,不是 DeepSeek 官方评测。开发者 karminski3 报告,在 reasoning_effort=max 的长程 AgenticCoding 测试中,模型倾向于提前停止(50 轮机会里 3 次测试有 2 次在 42-43 轮停止),并称该单次 case 未超过 GLM-5.1。

为什么重要。这是 DeepSeek 在 V4 Flash 之后的正式版旗舰,定价策略明显拉开与 Flash 的档位,同时保持对海外旗舰的价格优势。社区反应集中在“真强、真便宜”与“静默发布”的对比上。需要留意的是:价格表是开发者转述并注明“近期会上涨”;Terminal-Bench 成绩是 cline 团队声明;早停问题目前是单一测试案例,不能当作普遍结论。

源链接:

主题二:Grok 4.6 同价发布,Artificial Analysis 指数追平 GPT-5.6 Sol Max

发生了什么。SpaceXAI 发布 Grok 4.6,宣称相对 Grok 4.5 是“显著改进”且价格不变;发布当天即在 Cursor、Grok Build、OpenRouter 等平台可用。规格上,grok-4.6 上下文 50 万 token,文本+图像输入、文本输出,支持函数调用、结构化输出与推理。官方定位强调两项加强:长程 Agent(多步任务中稳定运行)和更重的交互与视觉工作(从产品想法直接到应用结构和视觉稿)。

关键证据。据社区整理的官方对比,Artificial Analysis 综合指数上 Grok 4.6 得 61,与 GPT-5.6 Sol Max 持平,比 Grok 4.5 的 56 高 5 分,距 Fable 5 Max 的 62 只差 1 分;相对 4.5 共 10 项全部上升,其中动手类任务涨幅最大:DeepSWE 从 54% 升至 65.9%、APEX-Agents 从 47.1% 升至 57.5%、Terminal-Bench 从 15.7% 升至 26%;知识工作 Elo 上 GDPVal-AA 从 1526 升至 1753、AA-Briefcase 从 1313 升至 1577。不过 APEX-SWE 只增加 2.8 个百分点,“写软件”这条线的提升并不均匀。价格维持在每百万 token 输入 2 美元、输出 6 美元,社区普遍对比“其他前沿模型的一半”。Cursor 团队开发者 Eric Zakariasson 的实战笔记给出更细的体验:长提示比短提示更具体有用,但真正拉开结果的是验收标准;模型“可自检性”决定哪些任务适合放手。

为什么重要。Grok 4.6 把“同价大幅提智”作为竞争手段,直接冲击 GPT-5.6 Sol Max 与 Fable 5 的定价体系。同时,“Grok 4.7 将在 3-4 周内发布、约 2.1T 参数”的说法在 X 上流传,属未证实传闻。另有开发者反馈 Grok 4.6 在相同提示下耗时明显长于 4.5,说明性能提升的代价未必只体现在价格上。

源链接:

主题三:阿里首次开源 Qwen-Max 级权重 Qwen3.8-2.4T-A95B

发生了什么。阿里 Qwen 团队开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型第一次开源。权重当天出现在 Hugging Face 上,NVIDIA AI 官方账号也转发了祝贺。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文,可扩展至 1,010,000 Token。

关键证据。Unsloth 团队在权重发布后即放出本地化方案:通过 Dynamic 1-bit 选择性量化,把 Qwen3.8-2.4T-A95B 从 4.9TB 压缩到 397GB(约 -91%),称可本地运行。社区对“今天还会有 Qwen3.8-27B”的猜测并未得到官方证实。

为什么重要。Qwen-Max 级模型开源意味着国内最大规模的 MoE 权重进入可自托管范围,配合 1-bit 量化,把超大模型的本地/低成本部署门槛又压低了一档。量化后的实际质量、推理速度与硬件需求目前没有独立基准,只有 Unsloth 的量产声明。

源链接:

主题四:Meta 开源 Muse Glimmer,30B 本地多模态模型上线 OpenRouter

发生了什么。Meta AI 超级智能实验室(Superintelligence Labs)的首个开放权重模型 Muse Glimmer 在 OpenRouter 上线。这是一款 30B 密集文本+图像模型,Apache 2.0 许可,定位为“可靠的本地智能体”。OpenRouter 给出的数据为 MCP Atlas 得分 75.5、SWE-Bench Pro 得分 51.2。

关键证据。社区解读认为 Muse Glimmer 体现了 Meta 从 Llama 3 到 Muse Glimmer 两年间的架构变化;有开发者称可以在本地运行和微调。基准数字来自 OpenRouter 的宣传页,未独立验证。

为什么重要。Meta 把超级智能实验室的成果直接以开放权重形式发布,走的是“本地可跑、可微调”的路线,与 Qwen3.8 开源同一天出现,形成开放权重阵营对闭源旗舰的又一次挤压。Muse Glimmer 的实际能力需要等社区评测,目前只有上线信息。

源链接:

主题五:大厂自研新模型:微软 MAI-Thinking-1、腾讯 WeLM 同日亮相

发生了什么。微软 AI CEO Mustafa Suleyman 宣布微软首个自研推理模型 MAI-Thinking-1“从零构建”,已在 Microsoft Foundry 上线。同一天,微信官宣自己的模型:WeLM-80B(总参数量 800 亿、每次推理激活 30 亿)已部署到微信原生 AI 助手小微,可以调用微信原生功能和小程序;另一款 WeLM-617B(总参数量 6170 亿、每次推理激活 230 亿)同步披露。

关键证据。MAI-Thinking-1 的信息只有 Suleyman 的一条 X 帖,无技术细节、无基准。WeLM 的信息来自微信官宣转述,社区讨论焦点是它与腾讯混元的关系——有开发者指出“腾讯有两个大模型,一个叫混元,一个叫 WeLM”。两家的披露都很薄。

为什么重要。微软首次拿出自研推理模型(此前更依赖 OpenAI 合作),微信把模型直接接进自家助手和小程序生态,这两件事都指向“旗舰模型竞争之外的第二战线”:企业把模型能力内化到自有产品里。由于缺少基准和更多细节,目前只能记录到“发布”这一层事实。

源链接:

主题六:Grok Bot:住在云电脑里的 AI 同事进入 beta

发生了什么。SpaceXAI 与 Cursor 合作推出 Grok Bot,一个可以持续操作应用和网站的 Agent。按官方说法,每个 bot 住在云端一台常驻 Linux 机器上,用你的登录状态翻网页、开应用、读写文件;碰到登录、二次验证、验证码、付款等关卡会把电脑交还给你,处理完再继续;你看它做一次,它就能存成固定流程,按时间或 Slack、Git 事件触发;多个 bot 之间可以互相发消息派活,由一个总控 bot 带一队专员。

关键证据。AI Valley 邮件提到定价:面向 SuperGrok Heavy 和 Cursor 订阅者 beta,团队 $120/席、个人 $200/月。社区测试显示 bot 的机器位于 Cloudflare San Jose 网段、126G 磁盘。Riley Brown 评论称,用过 Grok Bot 之后更能理解 Cognition 收购 Interaction 的逻辑,即“有自己电脑的 Agent”成为行业共识方向。

为什么重要。Grok Bot 把 Agent 从“给建议”推进到“接管操作”,且强调用个人登录态直接操作网站、不依赖对方 API。它的边界也很明显:定价与 beta 范围来自第三方邮件转述,机器人能力上限(多任务并发、长流程稳定性)尚无系统评测。

源链接:

主题七:Anthropic 多智能体研究:协调能发现更多漏洞,也可能传播“思维病毒”

发生了什么。Anthropic 发布多智能体系统研究报告,主题是当 AI 智能体在共享代码库、市场等社会系统中承担更多任务时,智能体间交互量可能超过人机交互。实验之一显示:45 个协调智能体在 2700 万 token 的运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法只有 12 个重叠;协调智能体还会自发学会专业化分工。研究同时警告,个体层面的良性行为怪癖可能叠加为意外的系统性失败。

关键证据。同方向另一篇论文做的是“思维病毒”传播实验:让一组智能体在共享编码项目上工作,并让另一组智能体在上下文被清空的情况下接力,发现观点和指令能通过共享工作产物跨会话传播;有害载荷传播较弱但偶尔仍会落地,而在系统提示词里加一句简短警告几乎可以完全免疫。有研究者点评这是理解多智能体系统风险的重要工作。

为什么重要。多智能体协作既有收益(漏洞发现率大幅提升)也有风险(行为模式在智能体之间传播、个体怪癖系统性放大)。这些结论来自实验室环境,真实生产系统的规模和多轮交互行为还没有同等证据。

源链接:

主题八:Claude 生成文本将带隐形水印,为 EU AI Act 合规做准备

发生了什么。Anthropic 宣布从 8 月 2 日及之后发布的模型开始,Claude 生成文本会嵌入人眼不可见、机器可读的信号,水印在复制、粘贴和部分编辑后仍可被检测;覆盖 Claude 的聊天、API 和 Claude Code,图像也有类似系统。AI Valley 的报道将其解读为 Anthropic 为满足 EU AI Act 透明度要求、让 AI 生成内容更易检测所做的动作。

关键证据。水印机制的技术细节(信号如何编码、检测阈值、误报率)没有公布。社区反应集中在“所有 Claude 输出从此可溯源”的讨论;也有开发者抱怨 Fable 5 的网络安全限制过严,询问水印原理时模型会自动降级到 Opus 4.8。

为什么重要。隐形水印是透明度监管下第一批落地的大厂方案之一,直接影响到内容平台、审核方和普通用户判断内容来源的方式。目前属于公司自述,实际检测能力和对生成质量的影响需要独立验证。

源链接:

高价值单点

  • Gemini 月活破 10 亿:谷歌宣布 Gemini 月活跃用户达到 10 亿,成为谷歌历史上最快达到该里程碑的产品;口径只统计主动打开 Gemini 应用或网页的用户,不计入通过其他谷歌产品间接使用的情况。
  • Codex 用户破 1500 万并发布 Linux 桌面版:OpenAI 的 Codex 活跃用户跨过 1500 万,Tibo 宣布向用户发放重置额度;同时 Codex for Linux 上线,完整桌面体验支持 Ubuntu、Debian 和 Fedora。
  • Claude Cowork 进入 Chrome 侧边栏:Claude in Chrome 扩展的侧边栏升级为 Claude Cowork 会话,对话保存至历史记录,技能和连接器可在浏览器中工作,任务可在桌面、网页和移动端之间切换。
  • Manus 复归独立:社区消息称 Manus 接近逆转被 Meta 收购的安排并恢复独立运营;AI Valley 与多条 X 帖方向一致,但均无官方声明,收购细节和交易状态仍不透明。
  • 前千问负责人林俊旸创办 Pragmatik Labs:新公司(语用科技,简称 p7k)方向是横跨数字世界与物理世界的下一代智能体,覆盖数字 Agent 与具身智能;投资方说法不一(一说高榕创投、一说腾讯跟投)。
  • CLAUDE.md 指令无限增长研究:对 1,867 个仓库、247,694 条指令生命周期的分析显示,提示文件会随时间无限膨胀(净增约 4.9 条指令/次提交);论文提出用注释记录指令理由,在可验证设置下移除了 99.3% 的多余指令,真实 agent 指令遵循最高提升 23.1%。
  • Google 发布 Recall 研究:知识画像框架发现前沿 LLM 的事实编码接近饱和但“回忆”能力不足,多数事实错误源于“丢钥匙”而非“空货架”;配套 WikiProfile 基准含 2,150 条维基百科事实、每条 10 个问题。
  • 开源视频流水线 48 小时连发:MiniMax H3 带火开源视频后,IndexTTS-2.5(0.8B,音色克隆)与 LTX-2.5(原生多镜头、9 套 ComfyUI 工作流、16GB 显存启动)接连开源,阿里 Wan2.2-Animate 用角色图复刻动作,NAVA(6.3B 原生音画、24GB 显存生成 720p)补齐配音、驱动、多镜头环节。
  • Higgsfield 完成 110 分钟 AI 长片:Higgsfield 与 Cully Games 用 AI 制作 110 分钟剧情长片,4 周完成、成本约 200 万美元,真人演员以肖像授权方式参与;制作过程(每条提示词、素材、角色)完全公开可复用。
  • 融资两笔:Lovable 完成 4 亿美元融资、估值 133 亿美元;CodeRabbit 完成 1.43 亿美元 C 轮、估值 15 亿美元。
  • 美国联邦政府设备恢复使用 TikTok:白宫管理与预算办公室撤销 2023 年禁令,理由是美国业务已重组为多数美资控股的合资公司(TikTok USDS Joint Venture),司法部上月也认定其不再符合“受管制应用”标准。
  • AutoGPT 用 AGENTS.md 管理 AI 生成的 PR:维护者发现 AI 智能体不会主动读文档,于是把指令放在代码目录旁的 AGENTS.md 和技能文件里,并用强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名做门控;其中 CLA 签名因需要浏览器和 OAuth 流程,被当作区分人类与智能体的“人类探测器”。
  • Nathan Lambert 的写作观察:作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,能改错字、做编辑,但组织整章内容仍混乱易错;编码、数学等任务已接近超人水平,写作却拖了自主解决开放科学问题的后腿。
  • ChatGPT Work 与 Codex 项目同步:OpenAI 开发者账号宣布可以从其他 Agent 导入项目、聊天、技能和插件到 ChatGPT Work 与 Codex,保持工作同步。
  • NVIDIA Nemotron 3.5 Lightning 上线 Nebius:30B 混合 MoE(约 3B 激活)架构的推理模型在 Nebius Token Factory 提供,社区称预览版在复杂测试中表现不错;该消息来自厂商与转发帖,尚缺独立基准。

🕐 小时信号精选

PT 时间 信号 为什么值得记住
20:36 Hugging Face CEO 宣布 Transformers.js 月下载量破千万,约 6 个月增长近 10 倍 本地运行 AI 的需求在量化层面加速
21:28 微信官宣 WeLM-80B/617B,小微助手已接入 微信首次把自研模型放进原生助手
21:49 Higgsfield 公布 110 分钟 AI 长片制作细节 AI 视频从片段走向完整生产流程
23:32 IndexTTS-2.5、LTX-2.5 等开源视频工具 48 小时内连发 开源视频从单素材转向可生产的流水线
00:41 DeepSeek Harness 公测截图在 X 流传 DeepSeek 可能同时开放模型与工具生态
02:20 CLAUDE.md 无限增长论文发布 指令文件的维护成本有了量化证据
03:47 Grok 4.7 传闻发酵(2.1T 参数、3-4 周后发布) 头部模型的迭代节奏明显加快
05:24 Stanford 上下文工程指南:记忆按离散条目累积可提升 10.6% agent 任务表现 Agent 记忆设计出现实证方向

编辑结论

一天之内,DeepSeek 与 xAI 在同一窗口发布旗舰,阿里与 Meta 同日放出开放权重,微软和腾讯各自公布自研模型——模型层的竞争密度明显高于前几周。真正值得持续观察的不是单个基准数字,而是三件事:开放权重阵营(Qwen、Muse Glimmer 加上 Unsloth 的量化)能否在本地真正跑出可用效果;DeepSeek V4 Pro 的早停争议与 Harness 生态开放是否会改变社区对它的评价;以及 Anthropic 的水印与多智能体研究是否会把“可追溯、可治理”从口号变成产品默认项。多数结论仍依赖厂商自述或单帖证据,后续一周的独立评测比发布当天的热度更有参考价值。

来源与方法

本次审阅 30 个原始捕获文件(21 个整点小时捕获 + aihot-morning、aivalley、hubtoday 三个有实质内容的命名源;chrome-dev、claude-blog、cline-blog、google-research、openai-blog 均为当日 0 篇 stub,xiaohu-ai 获取失败)。信号池整体丰富,模型发布、开源与 Agent 产品多源交叉;限制在于 hubtoday 为模板化摘要、多处留白,部分事件(MAI-Thinking-1、WeLM、Manus、融资)只有单一信源或公司自述,文中已就地标注。

微信搜一搜:智简 Smart&Concise 公众号二维码

关注公众号

智简 Smart&Concise

微信搜一搜,获取独立开发与 AI 实践更新。