每日编辑摘要

№ 20260801

OpenAI 内部版 Astra 用约 2000 美元解决 10 项数学与理论计算机科学难题;同日 OpenAI 把 Luna、Terra 价格再砍 20–80%

OpenAI 联合创始人 Greg Brockman 8 月 1 日发文,宣布内部版 Astra(下一代主力模型)用约 2000 美元 Sol API 成本,完成了 10 项数学与理论计算机科学领域的开放性难题,覆盖非 sofic 群存在性、Connes 刚性猜想反例、von Neumann 代数、高维球堆积、电路复杂度下界等,全部成果附 Lean 形…

OpenAI 内部版 Astra 用约 2000 美元解决 10 项数学与理论计算机科学难题;同日 OpenAI 把 Luna、Terra 价格再砍 20–80%

OpenAI 联合创始人 Greg Brockman 8 月 1 日发文,宣布内部版 Astra(下一代主力模型)用约 2000 美元 Sol API 成本,完成了 10 项数学与理论计算机科学领域的开放性难题,覆盖非 sofic 群存在性、Connes 刚性猜想反例、von Neumann 代数、高维球堆积、电路复杂度下界等,全部成果附 Lean 形式化证书与 CoT 推导。同日 OpenAI 把 Luna、Terra 价格再砍 20%–80%,Luna Max 在 Artificial Analysis 的 Agentic Coding 评测上对位 Sol Medium、价格约为后者 1/25。Anthropic 也发布 Claude Opus 5,在 IMO 2026 benchmark 拿到 42/42 满分,定价仅为 Fable 5 一半。DeepSeek 同步放出 V4 Flash 0731 的 GGUF 量化版,一台 192GB 内存的桌面即可完整跑下来,本地化不丢分。慕尼黑地方法院则裁定 Suno 在训练与输出两端侵犯版权、驳回合理使用抗辩,成为音乐生成模型在欧盟法域下第一例不利判决。这三件事把“前沿能力—推理成本—合规边界”三条线在同一天顶到了产业视野中央。

主题一:OpenAI 内部版 Astra 用 2000 美元解决 10 项开放难题

Brockman 推文披露的十项进展覆盖数学与理论计算机科学多条主线,包括:证明存在非 sofic 群(否定若干群论上的普遍性假设)、给出 Connes 刚性猜想的反例、在 von Neumann 代数与高维球堆积方向推进、在电路复杂度上拿到新的下界结果。OpenAI 已公开发布全部 10 项证明,并附 Lean 形式化证书与逐步 CoT 推导,按 Sol API 价格折算总计约 2000 美元。

机制上,Astra 是 OpenAI 自家描述的下一代多智能体模型家族,与 GPT-5.6 Sol/Luna/Terra 属不同代次。OpenAI 强调“在公开问题上同时跑出 10 个独立突破”是首次,因此把成本写成 ~$2000 的目的,是把“靠暴力搜索 + 大量试错”的隐含叙事锁死在可控价位上。OpenAI 还公开承诺团队“也尝试了其他重大开放问题但未成功,含 Millennium Prize”——这等于提前承认数学结论并不等于科学结论。

为什么重要:这是第一次有实验室在数学与理论 CS 这种形式化领域里,以模型而非人类研究者的身份一次性拿出 10 项长期难题的结果,且每项都给出机器可验证的形式化证书。它的可复制性、对非形式化领域的迁移能力、训练-推理耦合方式,目前都未公开。Yuchen Jin 让 Fable 5 反向评估称这些题“可能值 Fields Medal”;Gary Marcus 反复提醒“Astra 数学强 ≠ 通用智能”,并指出已有一名数学博士生(@henryquantum)发现至少一项证明在表述清晰度上存在缺陷。Sloan 研究员 poly Noamial(@polynoamial)也承认他们尝试了其他重大开放问题(含 Millennium Prize)但未成功。

争议集中在三点。第一,方法论不透明:OpenAI 没有公开模型在 10 项难题上的成功-尝试比、是否调用 Lean / Coq 等形式化工具、人类研究者在哪个环节参与。Gary Marcus 把它和当年社区对 OpenAI 早期大模型的反应归为同一类——结果先于方法,对外只看到 249 页成果页而非机制页。第二,形式化与开放问题的等价性:Tibo(@thsottiaux)说“这周属于效率提升,这个周末属于 10 项科学突破”;Bojan Tunguz 直接称之为“另一个 Deep Blue 时刻”。第三,是否等于 AGI / ASI:Marcus 用 2024 年与 Brundage 的公开赌约作锚——他愿意接受 Astra 在“5/10”门槛上算 AGI,但目前的公开证据远不到这条线。对开发者侧来说,最直接的变化是 test-time compute 这条工程路线从此有了第一份“以可验证成本拿到里程碑”的可复制剧本。

源链接:

主题二:OpenAI 同步把 Luna、Terra 砍价 20–80%,sol-advisor 进入一线用法

同日,OpenAI 把 GPT-5.6 体系下 Luna 和 Terra 的 API 价格再压一档:Luna 降幅 80%,Terra 降幅 20%。开发者社区随即开始用 Luna Max 当“高性价比前端 + Sol Medium 当后端”的混合编排。Dan McAteer 推介的 sol-advisor 范式是:用 GPT-5.6 Sol 做 orchestrator/advisor,把 Luna Max、Terra Max 派去当 implementer;@rasbt 给出的 Artificial Analysis Agentic Coding 散点图显示,Luna Max ≈ Sol Medium,Terra Max ≈ Sol High,价格只有后两者的几分之一。

机制:Sol/Luna/Terra 是同代 GPT-5.6 系下的不同档位,分别对应高/中/低推理强度;降价 + 智能路由组合后,单任务成本可以显著低于“全程用 Sol”的旧用法。Emad Mostaque 估算,加上 prompt caching,单个 Astra 数学案例的累计 token 大概在 1 亿级别,仍远低于 Codex 一周的订阅额度。

为什么重要:模型公司不再只比“分数”,而是开始把“每任务美元成本”摆到与 benchmark 等同的位置。这意味着 Agent 类应用的产品经济性正在被改写:原本每跑一次 agent 任务 1–3 美元,今天可以压到几美分;高频 AI 服务第一次有了规模化获客的可能。

源链接:

主题三:DeepSeek V4 Flash 0731 上线,284B 总参 / 13B 激活可装进 192GB 桌面

Unsloth 发布 DeepSeek V4 Flash 0731 的 GGUF 量化版:3-bit 约 103GB(110GB 总内存可跑)、4-bit 约 155GB、Q8 无损约 162GB。模型本体 284B 总参 / 13B 激活,约 96% 的路由专家权重原生以 FP4 存储,因此 Q8 无损版本只比 4-bit 大约 7GB,Unsloth 不需要二次重压。Terminal Bench 2.1 82.7、DeepSWE 54.4、NL2Repo 54.2,多项 Agent 与编码测试都超过此前的 V4 Pro Preview。

机制:DeepSeek 在 MoE 路由层做了量化感知训练,相当于把 FP4 写进了权重本体;社区再放 GGUF 时几乎只是重打包,而不是重新量化,因此能保住 V4 Pro Preview 之外的一段能力上限。Max For AI 把这条线和 Sam Altman 的“四个月前 GPT-5.4 旗舰能力现在只要 1/13 token 价”以及清华系面壁智能的“密度定律”(同参数能力约每 3 个月翻一倍)摆在一起读,结论指向同一件事:智能正在快速“商品化”。

为什么重要:模型能在一台 192GB 统一内存的桌面工作站上完整跑下来,且本地化不丢分,意味着“几万美元以内的本地工作站跑前旗舰”开始成立。Geekbb 在鹈鹕 SVG 测试中实测 V4 Flash + Codex 耗时约 15 分 46 秒、单次请求约 6 万 token;DeepSWE 54.4 也意味着 SWE 类任务第一次有了可全本地替代方案。同时 Artificial Analysis 的 cost-per-task 数据把“每任务成本”维度钉死:V4 Flash 综合任务成本 0.03 美元、综合指数 50;Claude Fable 5 成本 3.15 美元、综合指数 60,便宜约 105 倍、覆盖约 83% 能力。

需要注意的是,岚叔独立测试中 V4 Flash 的前端实测并未明显超过 GLM-5.2,Arena 的纯 HTML 生成排名偏后;DeepSeek 官方明明有 max 推理深度选项,Arena 上呈现的版本看起来不够严谨。这意味着 V4 Flash 更适合“快速出初稿 + 低成本”,精修仍需更强模型。Lobehub 等团队已经把“前端 DeepSeek + 难任务 GPT”的混合路由写成 OpenCodex 等本地代理的默认策略;Indie Fox 同步实测确认在成本、质量、速度三个维度都成立。

源链接:

主题四:Anthropic 发布 Claude Opus 5:在 IMO 2026 上 42/42 满分,定价不到 Fable 5 一半

AI Valley 转载 Anthropic 官方发布:Claude Opus 5 在 apps、Claude Code、API 三端同步上线,定位为“接近 Fable 5 智能,价格约为后者一半”。核心成绩:IMO 2026 benchmark 42/42 满分;在 coding、reasoning、agentic search、computer use 几项上同时刷到 SOTA;safety 维度被同步强调。

机制:价格 + 安全 + 能力三角同时拉,意味着 Anthropic 的商业策略已经从“对标 OpenAI 的最强模型”转向“对标最佳性价比”。Cursor 同日推出的 smart AI Router 把这件事做成产品——按任务特征自动选 GPT-5.6、Claude Sonnet 5、Claude Fable 5 等档位。

为什么重要:Claude Opus 5 + Cursor Router 这套组合,把“前沿模型 = 单一旗舰”的市场叙事直接改写成“按子任务智能路由”。对开发者来说,最直接的含义是按“用得起”而不是“用最好”来规划栈。

源链接:

主题五:YC 开源 QM 多 Agent Harness,工具表已扩到 350+,Slack/Web 原生

YC 联合 Garry Tan 同步公开了内部使用已久的 QM Harness。它把 memory、文件、keychain、权限、cron、sandbox 全部做 per-user / per-channel scoped 隔离;harness 与模型均可替换,Pi、OpenCodex、Codex、Claude Code 共用同一内核;原生支持 Slack 和 Web,MIT 协议,可一键部署到 Fly 或 AWS。YC 内部已经把工具注册表从最初的 ~20 个积累到 350+,覆盖会计记账、法务、活动运营、工程协作等真实业务线。

机制:QM 把 “Agent = 模型 + 沙箱 + 工具表 + 记忆 + 权限” 的整套工程化抽象开源出来,并明确把 harness 与模型解耦。这与今天业内同时出现的另一条线(OpenCodex、Memmy 等本地代理)形成强共振——前者是平台化方案,后者是开发者侧的反向解耦方案。

为什么重要:业内关于“agent 外壳和模型正在解耦”的判断,QM 给出了第一个被 350+ 工具验证过、可部署的开源实现。它意味着 SMB 也能像 YC 那样把多 Agent 流程跑在 Slack/Web 上,而不是被某一家模型厂绑定。Anna Zhang 透露 YC 内部原本就把所有 agent 会话全量广播,等于把“组织记忆”做成了默认产物——这与 OMARSAR 推荐的 AGENTS.md / CLAUDE.md 风格一脉相承,但 QM 是把这种工程化能力打包到一个可部署的项目里。Lucas Beyer 把它形容为“为工作而生的 OpenClaw 优化版”,对那些不想从零搭 harness 的小团队直接可用。

源链接:

主题六:德国慕尼黑法院认定 Suno 在训练与输出两端侵权,合理使用抗辩被驳

慕尼黑地方法院 8 月 1 日裁定,AI 音乐生成器 Suno 在训练过程与生成结果两端均侵犯版权,并驳回其合理使用抗辩。法院认定 Suno 3.5 与 4 版本模型可复现六首知名歌曲的原创元素,构成“记忆化”侵权,责任归于 Suno 而非使用 Suno 的用户。该判决还明确美国版权法下的合理使用不适用于本案,目前尚未最终生效,但已成为欧盟法域下首例对生成式音乐模型不利的主审认定。

机制:法院把“模型权重里复现了什么”和“模型输出里复现了什么”拆开判断,等于同时否定了“训练端合理使用”和“输出端纯工具免责”两条常见抗辩。案件最终生效后,欧盟音乐模型可能被迫引入训练数据来源审计与输出去重机制。

为什么重要:这是欧盟法域下第一次正式以“记忆化侵权”认定音乐模型全链路责任。它为后续图像、视频、代码类生成模型的版权判决立下参考线,并很可能影响欧盟 AI Act 在训练数据透明度条款上的执行口径。判决尚未生效,对应公司仍可上诉,目前不宜外推为最终规则。

源链接:

主题七:华为开源 openPangu-2.0-Pro:首颗全非 NVIDIA 硬件训练的 500B+ 前沿模型

华为官方宣布把 openPangu-2.0-Pro 开源,505B 参数、MoE 架构,号称是第一个完全在非 NVIDIA 硬件(昇腾 NPU)上完成训练的 500B+ 级前沿模型。meng shao 同步转发了 YC 内部的 QM Harness 开源消息。

机制:openPangu 2.0 Pro 在硬件栈层面与全球主流前沿模型拉开距离。配合 OpenAI、DeepSeek、Moonshot Kimi K3 在同一时间段把模型成本往下压,全球前沿模型第一次出现“美国厂主导开源生态、中国厂主导非 NVIDIA 算力栈”的双轨格局。

为什么重要:当一个 505B 级模型能够在完全脱离 NVIDIA 的训练栈上跑下来,证明非 CUDA 路线的训练工程已经具备生产可用性。对中国的算力供应链、训练框架以及国产 NPU 生态来说,这是 2026 年迄今最实质的进展之一。

源链接:

主题八:Snapchat 全面封禁纯 AI 生成视频进入 Spotlight 推荐流

Snap 8 月 1 日起正式拒绝任何“完全由 AI 生成”的视频进入 Spotlight 推荐池。规则不是“贴 AI 标签降权”,而是直接取消推荐资格;同时,AI 用于剪辑、增强、配音等辅助创作的视频仍可推荐,只需明确标注。Max For AI 把这与 YouTube 收紧模板化重复内容的变现资格、LinkedIn / Substack 处理 AI slop 摆在一起读。

机制:平台从“内容分发方”升级为“内容真实性的把关方”。完全自动生成与“AI 辅助 + 真人创作”被显式拆开,AI slop 从“可标注内容”变成“限流对象”。

为什么重要:内容平台第一次在产品规则层面,把“AI 替代创作者”和“AI 辅助创作者”分开处罚。这对纯 AI 短视频矩阵、批量生成内容农场是直接打击;对依赖 AI 工具但保持个人风格的创作者是利好。同期微软 AI 副总裁 Nando de Freitas 宣布离职(2024 年 9 月被 Mustafa Suleyman 招入),他说微软 AI 已具备完整模型体系(MAI-Image-2.5、MAI-Voice-2、MAI-Thinking-1),下一步是“持续迭代模型”,但这恰好是他选择离开的时点。

源链接:

主题九:Figure F.03 完全自主爬梯子——人形机器人迈过“人类基础设施”的门槛

Figure 公司发布视频,机器人 F.03 在没有任何遥控、云端接管的情况下,一步一步爬上一段真实金属梯子并站稳平台。Stanford AI Lab 引用 Annie Chen 的研究指出,real-time interactivity + task understanding + full-body action prediction 同时在线,对人形机器人而言是少数未解决的硬骨头。

机制:梯子是“为人类建造、机器人用不了”的典型设施。F.03 的视觉感知、手-足协调、实时重心控制全部在本地闭环完成,意味着它不再要求世界为它改变。

为什么重要:人形机器人领域目前以宇树后空翻、跳舞等“演示型动作”为主。爬梯子对人类来说零难度,对人形机器人却是 0 到 1——它是建筑工地、夹层检修、高处作业等“非平整地面”的入门门槛。这一爬把“实验室 demo”和“真实现场”的距离显著缩短。

短期内这一能力的成本和可靠性仍不充分:AYi 自己形容 F.03 “像 80 岁大爷一样慢”——动作慢而谨慎,每一次横撑定位都需要重新校准。但“能自主完成”和“速度快”是两条独立的工程曲线,前者是 0 到 1,后者只需要把现有算法持续迭代。结合今日同时放出的其他几条线(Snap 封禁纯 AI 视频、Suno 在欧盟被判侵权、OpenAI 把模型成本再砍 20–80%),可以把这看作 2026 年下半年“具身智能进入产业落地清单”的起点:硬件能闭环、企业能算账、监管能容纳,三件事首次同时成立。

源链接:

主题十:Karpathy autoresearch 思路被搬到 Claude Code / Codex,Agent 整夜自迭代成产品

GitHubDaily 推荐的开源项目 Autoresearch 把 Karpathy 的“让模型一夜跑百轮实验”思路落地为 14 个子命令的 Claude Code / Codex 技能:给一个目标 + 量化指标,Agent 自动循环改代码、跑验证、效果好留、效果差回滚;内置 9 个安全钩子防止误操作。

机制:它本质上是把“Agent 自己写 Agent”做成可重复的工作流,而不是一次性脚本。对个人开发者来说,“设好目标挂着跑、起床看结果”成为新常态。

为什么重要:当 Agent 能整夜自己调自己,模型评测、skill 工厂、AB 实验这类原本要靠人盯的循环,可以全部机器化执行。这条线加上 OpenAI / Anthropic 都在押的“test-time compute”,是 2026 下半年最重要的工程范式之一。

源链接:

高价值单点

  • Nando de Freitas 离开微软 AI:8 月 1 日宣布离开,曾任牛津教授 + DeepMind 首席科学家近十年,加入微软不足两年。他评价微软 AI 团队已经足够成熟,但自研模型体系刚搭起来、核心多模态负责人就选择离开,时间点微妙。下一站未明,他先去阿根廷安第斯山脉度假。
  • DeepSeek Harness 公开内测:DeepSeek Harness 负责人 tianyi 在 X 上公开召集内测成员,要求是 Agent Harness 相关开源项目;评论区里 @lobehub、Pi、OpenCodex 等已经表态。DeepSeek 模型 + 官方 Harness 的组合被视为下一轮 Agent 基础设施的关键卡位。
  • Cursor smart AI Router 上线:支持按任务在 GPT-5.6、Claude Sonnet 5、Fable 5 等档位之间动态路由,对应 Anthropic Opus 5 的“价格约为 Fable 一半”的定价策略。
  • Yann LeCun 与 Zuckerberg 互关:Yann LeCun 的 X 账号重新被 finkd 关注,被中文圈解读为 Meta 内部对前沿模型路线态度可能变化的信号。
  • AI 普及 vs. AI 成本两极化:Sam Altman 称“四个月前 GPT-5.4 旗舰能力现以约 1/13 token 价获取”;Max For AI 同步指出“前端初稿用 Flash 即可,精修才上更强模型”——产品侧的“按任务路由”已不再是可选项。
  • Pfizer 的 Graph RAG 生产案例:在 30% 生成式 AI 项目失败的 Gartner 预测下,Pfizer 团队用 chunk-by-chunk 入图 + 向量库并行查询架构,把数据清理时间从 3 个月压到 3 周。

🕐 小时信号精选

PT 时间 信号 为什么值得记住
00:00 Astra 在多领域同步放出 10 项数学/理论 CS 开放难题证明 一日内单模型最高密度的开放问题突破
00:30 Sol/Luna/Terra 降价 20–80%,sol-advisor 进入一线 评测分数之外,“每任务成本”开始成主轴
02:00 DeepSeek V4 Flash 0731 GGUF 量化发布 192GB 桌面可跑 V4 级,Q8 仅比 4-bit 大 7GB
04:00 Snapchat 全面封禁纯 AI 视频进入 Spotlight 平台首次在规则层区分“AI 替代”与“AI 辅助”
05:00 DeepSeek Harness 公开内测 DeepSeek 模型 + 官方 Harness 组合开始成形
06:00 Anthropic Claude Opus 5 发布,IMO 2026 满分 42/42 头部模型价格/能力曲线再被压一档
07:00 YC 开源 QM Harness(350+ 工具、Slack/Web 原生) 多 Agent 工程化抽象首次以可部署形式开源
08:00 Figure F.03 完全自主爬梯子 人形机器人首次在人类基础设施上自主闭环
10:00 微软 AI 副总裁 Nando de Freitas 宣布离职 自研模型刚搭完、关键多模态负责人离场
11:00 Karpathy autoresearch 思路落进 Claude Code / Codex Agent 整夜自迭代从概念变成现成技能

编辑结论

8 月 1 日被几件事同时顶上中心:OpenAI 内部版 Astra 把“模型 + 形式化证明 + 可验证成本”这条线推到从未到过的水位;OpenAI 同步把 Luna / Terra 价格砍 20–80%,把“每任务成本”摆到了与 benchmark 等同的位置;德国慕尼黑法院给了 Suno 一记重锤,把欧盟法域下音乐模型的合规边界第一次画清。这三件事之外,DeepSeek V4 Flash 跑进了桌面工作站、Anthropic Opus 5 在 IMO 2026 满分、YC 把 350+ 工具的 QM Harness 开源、Snap 全面封禁纯 AI 视频进入推荐流、Figure F.03 完全自主爬梯子——它们看似零散,但指向同一个方向:前沿能力、推理成本、内容真实性、机器人物理自主性这四条线,已经各自进入了产品可用的拐点区。

来源与方法

本日报基于 2026-08-01-pt 目录下的 1 份早间 AIHOT 精选、2 份命名来源(AI Valley、HubToday)及 19 份小时级 X 列表抓取合并而成。所有数字、模型名、价格、测试成绩均按原文抓取,未做交叉核验;OpenAI / Anthropic / DeepSeek 自报 benchmark 已注明出处;如需引用成本数据请同时核对官方文档。