Meta 开源 30B 本地 Agent 模型 Muse Glimmer,Anthropic 用未发布 Claude 刷新黎曼猜想相关下界
8 月 10 日 PT 当天最重要的变化集中在两处:Meta 重新回到开放权重路线,发布面向本地常驻 Agent 的 30B 模型 Muse Glimmer(Apache 2.0),并预告基础模型 Muse Spark 1.2 的权重也将开放;Anthropic 则公布一个未发布的研究版 Claude 把黎曼 ζ 函数零点位于临界线的比例下界从 41.…
Meta 开源 30B 本地 Agent 模型 Muse Glimmer,Anthropic 用未发布 Claude 刷新黎曼猜想相关下界
8 月 10 日 PT 当天最重要的变化集中在两处:Meta 重新回到开放权重路线,发布面向本地常驻 Agent 的 30B 模型 Muse Glimmer(Apache 2.0),并预告基础模型 Muse Spark 1.2 的权重也将开放;Anthropic 则公布一个未发布的研究版 Claude 把黎曼 ζ 函数零点位于临界线的比例下界从 41.6% 提升到 67.2%,是这一问题有记录以来最大单步提升。次要主线包括:OpenAI 发布网络安全专用模型 GPT-5.6-Cyber 并扩展 Daybreak 准入层级;英伟达联合六大金融机构建立 5000 亿美元级别的 AI 算力融资平台;Claude Sonnet 5 把促销价 $2/$10 永久化。需要区分的是:模型 benchmark 与数学进展均来自厂商自述或研究团队披露,尚未有第三方独立复现;英伟达融资平台中的 5000 亿美元是计划动员的第三方资本规模,不是已到位的资金。
一、Meta 开源 Muse Glimmer:30B Dense 本地 Agent 模型,Spark 1.2 权重预告开放
Meta(经 Superintelligence Labs,由 Alexandr Wang 带队)发布开源权重模型 Muse Glimmer,约 29.6B 参数、Dense 架构,支持图像与文本输入、约 131K 上下文,从 Muse Spark 蒸馏而来,训练重点放在 Agent 场景:多步推理、工具调用、编码与失败恢复。权重以 Apache 2.0 发布,可在 24GB 显存的消费级显卡上运行;社区整理的数据显示 4bit 量化后体积不到 20GB,RTX 5090 配合推测解码可达约 233 tok/s,M4 Max 约 37.8 tok/s。扎克伯格同时确认 Muse Spark 1.2 的权重也将开放,Meta 官方称后续还有更大的模型。
厂商公布的 benchmark 数字包括 SWE-Bench Verified 76.0、SWE-Bench Pro 51.2、TerminalBench 2.1 51.7、MCP Atlas 75.5、DeepSearch QA 74.6;LMSYS 博客宣布 SGLang 为该模型提供 Day-0 推理支持,并针对 Agent 工作流做了专门优化,Hugging Face 上已有 GGUF 版本。这些数字均为 Meta 与合作伙伴自述,未经第三方独立复现。
这一动作被社区普遍解读为 Meta 重新回到开源竞争:Muse Spark 系列此前走封闭路线,如今 30B 的 Agent 专用模型以最宽松许可证放出,意图抢占“本地 Agent 心智”与开发者部署生态;LeCun、Andrew Ng、François Chollet 等人在 X 上集中转发表态。争议点同时出现:Gary Marcus 连续发文强调 open-weight(开放权重)不等于 open-source(开源),指出多家媒体把两者混为一谈,权重开放不涉及训练数据与完整可复现性。
源链接:
- https://www.lmsys.org/blog/2026-08-10-meta-muse-glimmer
- https://x.com/AIatMeta/status/2086757844544811485
- https://x.com/alexandr_wang/status/2086756152034066792
二、Anthropic 公布研究版 Claude 的黎曼猜想进展:零点比例下界 41.6% → 67.2%
Anthropic 发布研究文章,称一个未公开的研究版 Claude 在尝试证明黎曼猜想时,虽未解决猜想本身,但把黎曼 ζ 函数非平凡零点落在临界线上的已知比例下界从 41.6% 提升到 67.2%。这一问题的历史推进节奏很慢:1942 年 Selberg 证明有正比例,1974 年 Levinson 推到至少三分之一,1989 年 Conrey 到五分之二,2020 年 Pratt 等人到 41.7%;从约 33% 到 41.7% 人类用了近 50 年,Claude 这一步约 26 个百分点的提升是历史上最大单步跳跃。
过程细节比结果更值得注意:Anthropic 一位非数学背景员工在 Claude Code 中发起任务,Claude 先后生成约 650 个思路,协调约 60 个子智能体、运行约 2400 条命令;Anthropic 数学家 Levent Alpöge 与 Ralph Furman 完成验证,外部专家 Brian Conrey、Dan Goldston 参与审阅,Claude 还用 Lean 写出了可机器验证的证明。Anthropic 明确表示,这一技术路径不太可能直接导向黎曼猜想的最终证明。三周前同一团队曾用 Claude Fable 5 找到 Jacobian 猜想的反例,两次都是在前沿问题上找到新路径而非解出标准习题。进展属研究团队披露,独立数学界尚未完成完整同行评议。
源链接:
三、OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,扩展 Daybreak 准入层级
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,面向授权的漏洞研究、漏洞验证与安全测试;同时把 Daybreak 拆成 Blue 与 Red 两个准入层级,并允许已批准的 Daybreak 合作伙伴用前沿网络模型向客户提供受治理的安全服务。Greg Brockman 与 Tibo 均以“把前沿智能交到防御者手中”为口径官宣,称这一模型是 OpenAI 首次大规模尝试直接提升该方向能力。
背景信号来自 AI Valley 的汇总:OpenAI 据报正在准备代号 Astra 的新旗舰模型(很可能是 GPT-6),传闻参数量约 10 万亿,原定本月发布,昨日因安全顾虑暂停;Anthropic 内部评估据称认为代理编码能力已触及风险阈值,OpenAI 将主动放缓开发节奏。上述均为未证实的媒体报道,证据边界应保持清晰:GPT-5.6-Cyber 本身是官方发布,Astra/Doug 的发布窗口与参数规模属于传闻。
源链接:
- https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
- https://openai.com/index/putting-frontier-cyber-models-in-more-trusted-hands
四、英伟达联合六大金融机构,为 AI 算力搭建 5000 亿美元级别的融资平台
黄仁勋宣布英伟达与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 合作,建立独立融资平台,动员超过 5000 亿美元第三方资本支持 AI 基础设施建设。英伟达称可为最多 25% 的项目提供兜底,即理论上最高约 1250 亿美元;Goldman Sachs 提出建立由英伟达算力支撑的信贷市场。模式上接近把 GPU/AI Factory 当作电厂、收费公路一类基础设施资产做融资:华尔街出资建设算力资产,AI 公司长期使用并付费。
关键在于英伟达把“买算力的钱从哪来”当成自己的问题来解决,将 GPU 包装为新的可投资资产类别,论据是 CUDA 软件持续更新延长硬件有效寿命、GPU 可在不同客户间转移。5000 亿美元是计划动员的第三方资本规模,不是已到账资金;25% 兜底是上限承诺而非确定出资。社区评论集中在“算力金融化”对中小 AI 公司资本开支结构的影响,也提示此类平台的实际落地节奏存在不确定性。
源链接:
五、Claude Sonnet 5 促销价永久化,Claude Code 自动模式默认开启
Anthropic 官方宣布,Claude Sonnet 5 六月的首发优惠价(每百万输入 token 2 美元、输出 10 美元)不再按原计划于 8 月 31 日结束,改为永久价格。原计划 9 月 1 日起涨价 50% 的传闻随之失效。社区评论认为这使 Sonnet 5 在与 GLM 5.2、Kimi K3、GPT Luna 等竞品的价格对比中明显更有竞争力,有开发者估算实际使用成本约下降三分之一。这是厂商定价声明,具体对比依赖各家计费口径。
同一窗口内,Claude Devs 官方账号解释 Claude Code 已把自动模式(auto mode)设为默认,用户不再需要对每个操作批准;官方同时宣传新模型对藏在网页或文档里的恶意指令做了专门防御,自动模式计划下周成为默认设置。默认自动执行会显著改变编码 Agent 的安全边界,属于产品行为变化,官方演示视频不能替代真实环境的风险评估。
源链接:
- https://x.com/claudeai/status/2086891169217122586
- https://x.com/ClaudeDevs/status/2086844755770757531
六、Anthropic 为 Claude 输出加机器可读标记:文本水印与 C2PA 元数据
Anthropic 宣布自 8 月 2 日起,所有新发布 Claude 模型在输出中执行两层标记:文本层嵌入人眼不可见的水印,复制到邮件、文档、博客后仍可被机器检测;文件层为生成的 SVG、PNG、JPG 附加符合 C2PA 标准的签名元数据。覆盖 API、官网、Claude Code、Claude Cowork、Claude Tag 全产品线,全球生效,依据是欧盟 AI 法案第 50 条的透明度行为准则;通过 AWS、Google Cloud、Microsoft Foundry 调用时文本水印同样生效,文件元数据取决于云平台支持。
限制被明确说明:检测到水印只能说明内容“可能经过 Claude 处理”,不能确认 Claude 是原始作者;大量改写会使水印消失,过短文本信号不可靠,格式转换或截图会丢失元数据。此前 OpenAI 开发过文本水印方案但未上线,Anthropic 是主要大模型厂商中第一个在文本层落地水印的。对依赖 Claude API 构建产品的团队,这是一个需要评估的合规与产品变化。
源链接:
七、豆包进入酒店预订抽佣:AI 助手开始切入真实交易链路
据媒体报道,8 月 10 日起抖音生活服务针对特定渠道启用新的软件服务费政策:用户通过豆包搜索、咨询酒店,并从豆包入口跳转至抖音来客完成预订的订单,向酒店收取 11.4% 软件服务费加 0.6% 支付手续费,综合费率约 12%。这意味着豆包从“聊天入口”进入消费决策与交易分账环节,AI 助手不再只靠会员订阅和模型 API 变现,而是让 AI 负责需求理解、由抖音承接交易、按 GMV 抽佣。
这是单渠道媒体/社区信息,费率与覆盖范围以字节跳动官方说明为准;“餐饮、旅游、电商会复制该模式”属于评论者的推演而非事实。其信号意义在于:头部国民级 AI 应用开始把商业化模型从订阅扩展到交易分佣,AI Agent 争夺的入口从用户时长延伸到交易闭环。
八、Cloudflare 多线动作:Agent 浏览器引擎 Kitesurf、政府云认证与 AgentsWeek 收官
Cloudflare 推出 Kitesurf,一个专为 Agent 设计的浏览器引擎,运行在 Workers 上,遵循 Chrome DevTools 协议,因此任何能操作 Chrome 的代理程序都可以直接操作 Kitesurf,官方称 beta 阶段免费,目标是替代昂贵 Chrome 实例作为 Agent 的“眼睛”。同一窗口内,Cloudflare for Government 获得 FedRAMP Class D (High) 认证,并宣布将申请 DoD IL4 授权;公司还发布了 AgentsWeek 收官 recap,覆盖从 Wallets 到 Radar 的一批 Agent 相关产品。
三件事互相关联:浏览器基建、政府合规、Agent 产品矩阵同时推进,表明 Cloudflare 在把 Agent 工作负载当作基础设施生意经营。Kitesurf 仍处于 beta,定价与 SLA 未公布,性能与稳定性证据有限。
高价值单点
- 阿里开源 Qwen-MM-Plugins:千问团队把读图、读视频、读文档、语音、3D 建模等能力封装为 Skill + MCP 双层结构,可注入任意 Agent 框架,让纯文本 Agent 获得多模态能力;社区讨论将其视为给 DeepSeek、GLM 等文本模型“补上眼睛和手”的方案。
- 微软开源 Skill Recorder:录制一段 GUI 操作(可同时口述),AI 自动还原为意图和步骤并生成可编辑、可复用的 Agent Skill,把“写 Skill”从写文档变成录一次操作。
- DeepSeek“给用户取外号”事件:用户发现 DeepSeek 深度思考时会在内部推理中生成临时称呼(如“墨墨”),冲上热搜后官方回应称这是推理时的上下文占位符,不跨会话保存、不建立用户档案;属于模型行为解释,非用户画像功能。
- a16z 数据:计算机操作 Agent 显著进步:OSWorld-Verified 基准上最佳成绩一年内从约 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先;为厂商/风投发布的基准数据。
- tl;dv 会议录音大规模暴露:安全研究者披露 AI 会议记录平台 tl;dv 的 Firestore 数据库缺租户隔离,18.1 万段录音、涉及 8.4 万用户与 3.5 万域名(含 23 国政府)可被已认证用户查询,约 1000 场录制中的会议存在被实时闯入风险;漏洞自 2026 年 1 月报告后 6 个月未修复。
- Meta 面临四州未成年诉讼:加州、科罗拉多、肯塔基、新泽西指控 Meta 通过产品设计让未成年人沉迷并误导公众,8 月 12 日在奥克兰联邦法院开庭,四州给出的最高罚款测算达 1.4 万亿美元(约合 Meta 市值 92%);Meta 称该计算“没有先例”。此前新墨西哥州相关案件已累计约 9.4 亿美元。
- Kimi 一级市场抢购老股:市场消息称 180 亿美元估值的老股额度被秒空,Pre-IPO 轮投前估值报 500 亿美元,一年内估值从约 43 亿美元涨约 10 倍;真假消息混杂,Kimi 曾公告老股转让须经公司批准。属市场传闻,未获公司确认。
- OpenAI Astra/Doug 传闻:AI Valley 与社区信息称 OpenAI 准备代号 Astra 的旗舰模型(约 10T 参数,可能为 GPT-6),原定 8 月发布、昨日因安全顾虑暂停,另有代号 Doug 的更大模型;均未证实。
- 研究进展两则:Google 发布 DiffusionGemma 完整技术报告(扩散模型做文本生成,据称训练成本大幅低于传统路线);Meta 提出 Skaling law,把模型容量与数据规模通过单一交互指数耦合,称在数据稀缺与过训练区间把预测误差降低 1.5–3 倍,并可用约 1/10 算力外推完整网格。
- 海外短剧 AI 报告:DataEye 报告称上半年海外短剧 APP 内购约 12.7 亿美元(同比 +13%)、下载 14.41 亿次(+79%),中国厂商贡献约 93% 收入与 85% 下载;TikTok 上半年短剧分账 8200 万美元,约 40% 的短剧消费时长来自 AI 内容。AI 内容在海外短剧供给中的占比已达可观水平。
- 100 万美元无限 Token 试验:一个 20 多人的团队获得 100 万美元预算、不限量使用 AI 后,结论是“人更累、AI 成本比人还高、组织架构仍为人设计”;属单团队自述,但指向组织流程而非模型能力成为效率上限。
- 微信朋友圈 AI 帮写与点评内测:微信基于小微推出朋友圈 AI 帮写(根据图片与已写文字生成 3 条文案)与 AI 点评内测,公众号端小微常驻首位并自动总结常看文章;作者观点认为这会鼓励 AI 内容、影响“记录美好生活”的社区基调,属评论性内容。
- Stagehand v4 发布:Browserbase 团队发布浏览器 Agent SDK Stagehand v4,Harrison Chase 团队配合发布用 Managed Deep Agents 构建网页浏览 Agent 的教程,浏览器正成为自改进 Agent 验证循环的默认工具。
- Hermes 生态热度:社区整理的 Top Apps 榜显示 Hermes Agent 当日 Token 用量约 1.36T,超过第 2–10 名总和;GitHub 上出现一批 Hermes 技能工厂、插件全家桶与工作区项目。属社区热度信号,非官方数据。
🕐 小时信号精选
| PT 时间 | 信号 | 为什么值得记住 |
|---|---|---|
| 03:00 | Claude Sonnet 5 官宣 $2/$10 永久定价,取消 9 月涨价计划 | 定价决策落地,直接影响 API 开发者成本预期 |
| 10:00 | Anthropic 公布黎曼猜想相关突破与完整论文、Lean 证明 | 数学前沿单步提升 + 可机器验证证据链 |
| 18:00 | 阿里开源 Qwen-MM-Plugins,DeepSeek/GLM 社区讨论接入 | 多模态能力以 MCP 插件形式外挂到任意文本模型 |
| 19:00 | webAI 开源 3B 形式化推理模型 TwiL-LM3,称 4/5 项基准超 GPT-OSS-120B | 小参数模型在形式化推理方向的效率对比(厂商自述) |
| 20:00 | 英伟达官宣 5000 亿美元算力融资平台 | 把 GPU 变成可融资资产类别的基础设施尝试 |
编辑结论
这一天最值得记住的不是单一新闻,而是两个方向同时加速:Meta 用 Apache 2.0 的 30B Agent 模型重新争夺本地部署生态,Anthropic 用研究版模型在数学前沿制造出可验证的增量——两者都把“完成任务/解决难题”而非“对话质量”当作展示重点。商业侧,OpenAI 与 Anthropic 同时在安全专用模型与定价上出牌,英伟达则尝试为算力需求配上金融工具。需要持续观察的是:开放权重引发的“open-weight vs open-source”争论、Astra/Doug 传闻背后的发布节奏,以及 12% 抽佣等 AI 交易分账模式能否从酒店扩展到更多品类。
来源与方法
本次日报审阅 2026-08-10 PT 目录下 21 个小时抓取与 4 个有效命名来源(AI HOT 早间精选、AI Valley、HubToday、OpenAI Blog),共约 31 万字节原始输入;另有 5 个命名来源为不足 500 字节的 stub,未提供实质信号。信号池判定为 rich。所有 benchmark、定价与融资数字均标注厂商/媒体自述属性;Meta 诉讼罚金、Kimi 估值、Astra/Doug 发布计划等为传闻或测算,未按事实陈述。