每日编辑摘要

№ 20260907

GPT-6 Astra 被黄仁勋称为“首个 AGI”,算力、配额与实测争议同天爆发

当天最重要的变化围绕 GPT-6 Astra 展开,三条线索相互拉扯:黄仁勋称 OpenAI 用约 10 万+ Grace Blackwell NVLink72 训练出“首个 AGI”,学界随即质疑定义、计量单位与成本;同一时间 Astra 容量吃紧,Plus 用户报告 5 小时配额下几乎不可用;第三方实测则显示它在真实工作任务上以 10:5 领先 C…

当天最重要的变化围绕 GPT-6 Astra 展开,三条线索相互拉扯:黄仁勋称 OpenAI 用约 10 万+ Grace Blackwell NVLink72 训练出“首个 AGI”,学界随即质疑定义、计量单位与成本;同一时间 Astra 容量吃紧,Plus 用户报告 5 小时配额下几乎不可用;第三方实测则显示它在真实工作任务上以 10:5 领先 Claude Fable 5.1。另一条主线是算力军备:Anthropic 被曝已锁定 5170 亿美元算力合同,中国最高法发布涉 AI 纠纷审理意见,AI 数学形式化出现费马大定理级别的进展。以下主张凡来自厂商、单一社交帖或二次聚合的,均标注证据边界。

一、黄仁勋称 OpenAI “首个做出 AGI”,训练规模口径引发成本之争

黄仁勋在 X 上回复 OpenAI 相关讨论时称,GPT-6 Astra “训练使用约 10 万+ NVIDIA Grace Blackwell NVLink72”,并描述从 ChatGPT 到 o1 再到 Astra 的演进路径;社区将其解读为“OpenAI 是首个达成 AGI 的团队”。Greg Brockman 转述黄仁勋的祝贺时也提到约 10 万+ NVLink72 的训练规模,并说接下来还有 GPU 上线。

关键争议在计量单位。Gary Marcus 指出,若“100K+”指的是 NVLink72 机柜(每柜含 72 颗 Blackwell GPU),硬件价值接近四分之一万亿美元,租赁也在数百亿美元量级;若仅指 GPU 颗数,按 Verda 公开租价 8.62 美元/GPU/小时推算,10 万颗 GPU 一天的租金约 2070 万美元、一个月约 6.2 亿美元,3 个月全天候预训练约合 18.6 亿美元。Marcus 同时批评“无证据、无定义”,列举 OpenAI 自 2023 年 11 月以来多次 AGI 宣称的历史;Epoch AI 的评估则认为该性能提升并未偏离既有趋势。

证据边界:黄仁勋原文在“4…”处被截断,10 万+ 到底指 GPU 还是机柜没有官方澄清;成本数字建立在公开租价与假设之上,属于社区推算;不同研究者对“AGI 是否已达成”分歧明显。这条线是当天讨论量最大的结构性议题,但远未定论。

源链接:

二、Astra 容量现实:排队、“模型已满”与“全局重置”传闻

与“AGI 已达成”的宏大叙事相对,普通用户的体验是容量紧张。当天多位独立用户报告:对话被提示更换模型、持续遇到“容量不足”或排队,有 Plus 用户称在 5 小时限额下即使轻量模式也基本用不上 Astra。中文社区从凌晨开始记录“开多少新对话都模型已满”,到当天傍晚仍未恢复。部分用户摸索出变通办法:用手机端 ChatGPT 远程控制 Codex,实测远程会话 2 小时无卡死,而桌面端 10 秒即卡死,安卓端暂未开放。

傍晚出现“一次全局性的 Codex 重置”预告,随后有用户称 Astra 额度已重置、可以继续使用;也有用户转述 Tibo 一方否认“额度重置”的说法。官方没有发布容量或配额说明。

意义:Astra 发布后的瓶颈从模型能力转向算力与配额管理。对重度用户来说,可用的推理额度直接决定工作流;而“是否发生过全局重置”这类基本事实要靠用户互相确认,说明容量分配仍不透明。

源链接:

三、第三方实测 Astra 10:5 领先 Claude Fable 5.1,基准口径仍在快速变动

一份流传较广的第三方实测用 15 个真实工作场景对比 GPT-6 Astra 与 Claude Fable 5.1,最终比分 Astra 10 比 Fable 5。典型差距在成本与效率:同一份咨询风格报告,Fable 花费约 26 美元、37 分钟,Astra 约 12 美元、23 分钟;一封销售信,Fable 产出约 2800 字、花费约 4 美元,Astra 约 1300 字、1.43 美元;一场领导层会议的材料处理,Fable 约 46 美元、有效代理时间只有 6 分钟,Astra 约 5.5 美元。Fable 也有反超场景:税务分析任务 Fable 约 13 美元、22 分钟,Astra 先问了约 7 个问题再处理 3739 行交易台账,花约 22 美元、40 分钟;60 秒回顾片任务 Astra 更便宜但出现字幕人名张冠李戴。

同一时期多个基准的口径在快速变化:有测试称 MazeBench 上 Astra 对 Fable “差距悬殊”;TerminalBench 从 2.1 更新到 4.0 后 Astra 已追平 Fable;另有实验室称 Astra 在 Blueprint-Bench 2 排名第一、3D 空间理解接近人类。

证据边界:这些是个人或第三方跑分,不是机构基准;同一模型在不同任务与基准版本下结论相反,说明评测口径尚未稳定。可确定的趋势是:Astra 在长尾真实任务上的成本优势明显,但质量并非全面领先,字幕级错误说明细节可靠性仍有短板。

源链接:

四、Anthropic 被曝锁定 5170 亿美元算力合同,估值与政府信任同时升温

据 The Information 报道(经 The Decoder 转载),Anthropic 在 11 个月内签署了总价最高 5170 亿美元的算力合同,自 2025 年 10 月以来锁定至少 14.8 GW 算力,并计划自建数据中心。报道标题提到 Anthropic CEO Dario Amodei 此前曾警告同行不要冒“鲁莽风险”。该数字若属实,是迄今公开报道中单家 AI 公司最大的算力承诺。

同一时期出现两条相关讨论:分析师按 ARR 增长假设测算 Anthropic 企业价值约 1.64 万亿美元(20 倍 EV/ARR,含对 Meta 投资、云分成与蒸馏相关收入的扣减调整),以此支撑一级市场约 1.4 万亿美元估值;Gary Marcus 引述称 Anthropic IPO 已推迟,但该说法没有独立信源。另一条机构信号来自美国国防部:Reddit 转述称国防部仍维持对 Anthropic 的禁令,不受商务部长 Lutnick 相关说法影响。

证据边界:5170 亿美元与 14.8 GW 来自媒体报道而非官方披露,最终落地金额和执行周期待验证;估值测算建立在假设性 ARR 增速上;国防部禁令为社区转述。整体看,Anthropic 处于“算力合同规模最大”与“政府信任门槛最高”并存的特殊位置。

源链接:

五、中国最高法发布涉 AI 纠纷审理意见,换脸拟声、仿冒带货有了裁判规则

最高人民法院发布《关于依法审理涉人工智能纠纷案件的意见》,共 5 部分 24 条,明确 AI 换脸拟声、AI 复活逝者、大数据杀熟、仿冒名人带货、网络开盒以及自动驾驶事故等情形的裁判规则。文件规定:未经同意生成可识别的虚拟数字形象或合成人声,构成对人格权和声音权益的侵害;仿冒名人带货构成欺诈的,消费者可主张惩罚性赔偿;车辆缺陷与驾驶人过错结合造成损害时,受害人可同时请求驾驶人以及生产者、销售者承担责任。

意义:这是中国法院系统首次以专门文件集中回应生成式 AI 的民事裁判问题,把“AI 复活”“AI 带货”“开盒”等过去主要靠个案讨论的情形变成明确规则。对企业而言,合成内容授权链条和自动驾驶责任边界将直接影响产品设计与合同安排。

源链接:

六、DeepSeek 双动向:16 万张昇腾订单传闻与 150 个社招岗位

一条 X 帖子转述此前报道称,DeepSeek 正为其内蒙古算力枢纽寻求约 16 万张华为昇腾芯片;马来西亚一个 4.94 亿美元的 AI 项目也在考虑采用昇腾 910C;美方据称警告各国不要使用华为芯片,尤其针对 910C。同日,DeepSeek 启动新一轮社会招聘,放出约 150 个岗位,社区转帖称岗位集中在资深后端与服务端工程师,被解读为新一轮扩张信号。

证据边界:昇腾订单属于对既往报道的社交转述,原始信源与合同状态未在档案中独立出现;招聘数量来自岗位转述帖。若 16 万张订单属实,它意味着中国头部模型公司在英伟达之外开辟第二条大规模算力供应链;即使只是意向,也说明国产芯片在训练集群中的份额讨论已进入实质阶段。

源链接:

七、AI 数学形式化:费马大定理进入 Lean,陶哲轩提醒“太快给答案”有代价

凌晨出现转述帖称 Anthropic 用 Lean 定理证明器形式化证明了费马大定理,把数学界约 350 年的难题搬进机器可验证体系,被视为形式化数学的里程碑级项目。随后流传更具体的案例:Replit 创始人 Amjad Masad 展示 Claude 用 11 天写出约 1300 万行 Lean 代码,把人类已有的费马大定理证明改写成计算机可逐步检查的形式;该工程此前失败过,加入管理任务依赖与协作进度的工具后才推进成功。Masad 认为“任何能转成编程问题的研究问题几乎都解决了”,转述者认为这句说得太满。

同一天还有方向相反的提醒。国内媒体报道陶哲轩对 AI 数学能力提出告警:模型太快给出答案,可能遮住失败路径,而数学进步既靠正确结论,也靠知道哪些路为何走不通。报道还提到 GPT-6 Astra、Anthropic 与 Axiom 围绕孪生素数有界间距的形式化进展;另有研究者验证并简化了 Claude 关于 zeta 零点的证明,AxiomProver 在数小时内完成形式化。

证据边界:费马大定理项目来自社交转述,档案中没有 Anthropic 官方公告或论文链接;陶哲轩表态、孪生素数与 zeta 零点进展来自聚合源转述,部分数字在转写中缺失。可以确认的方向是:AI 写证明、人类提纯、机器验算开始连成同一条流水线,同时数学界对“正确但不可解释的快”保持警惕。

源链接:

八、OpenAI 内部张力:首席科学家呼吁放慢,工具团队与监控成话题

OpenAI 首席科学家 Jakub Pachocki 在一篇名为《An Alien Mind》的文章中呼吁行业不要把“最大速度扩展”当作默认选项。据 AI Valley 通讯摘要,他认为今天的系统更多是“长出来”而不是“设计出来”——是大量优化运行的产物,而非任何人完全理解的头脑;因此不能假设这种智能会自动继承人类原则。他把转折点定在 2023 年中的 RLSlow 项目,那是推理模型首次展示可持续扩展,并认为这种节奏还会继续。

与“放慢”呼声形成张力的是内部用量数据:有转述称 OpenAI 内部研究员的日常 Coding Agent 用量在 2026 年年中后涨得非常快,每日中位数数字在原文截断。另有两条来自内部生态的信号:技术媒体人爆料 OpenAI 招了一批前 Meta 员工,部分人提议在内部组建工具团队,被管理层叫停,理由是“AGI 优先的世界不需要内部工具团队,要什么工具随时可以现场生成”——该说法为单一爆料,未获官方确认。此外,OpenAI 披露内部 coding agents 错位监测后,社区开始争论思维链可见性与模型学会规避监控的风险:有人担心监测方法进入训练语料后,未来模型会学会绕开探针。

证据边界:Pachocki 文章内容来自通讯稿摘要且原文截断;工具团队被叫停是单方爆料;错位监测与内部用量均来自转述。四条线索共同指向同一个问题:OpenAI 内部对 scaling 速度、工程组织方式与安全监控的态度,正在成为公开讨论的议题。

源链接:

高价值单点

  • 微软开源 tgrep:基于 trigram 倒排索引的代码搜索工具,大型 monorepo 下最高比 ripgrep 快 50 余倍;索引 Linux 内核仓库峰值内存约 150 MiB,远低于内存方案的 2.2–3.8 GiB;兼容 ripgrep 旗标与 JSON 输出。https://x.com/shao__meng/status/2097123046721257846
  • PyTorchCon China 2026 在上海开幕(与 KubeCon 等合办):官方公布 torch 上月 PyPI 下载量超 8000 万次,过去一年活跃贡献者 3929 人(同比 +44%),vLLM 贡献者从 2024 年 12 月的约 740 人增至 3400 人以上。https://x.com/PyTorch/status/2097131911110123912
  • 腾讯开源 TeamAI CLI:以 Git 仓库为唯一事实来源,把 Skills/Rules/Hooks/MCP 配置同步到十余种编码工具,腾讯内部已使用半年;强调“摩擦信号”过滤,只把打断、拒绝、重试失败沉淀为经验。https://x.com/shao__meng/status/2097141170577289708
  • GPT-6 Astra 操控 Blender 保姆级教程:实测三种玩法,Computer Use 花约 4 小时搭出天坛祈年殿,耗掉 200 美元 Pro 会员额度近半;MCP 可完成摩托车建模与组装动画,复杂任务单次超时可拆分步骤或改用 CLI 执行 Python 脚本。https://mp.weixin.qq.com/s?__biz=MzIyMzA5NjEyMA%3D%3D&mid=2647686056&idx=1&sn=c1710404c08cf3201da27f4d53f94940
  • Qwen 发布 Qwen3.8-Flash-Next 架构报告:125B 总参数、6B 激活参数、51B 主机内存 n-gram 嵌入表;14 项基准中 8 项超过上一代 397B-A17B 旗舰。训练成本等数字在聚合源转写中缺失。
  • GLM-5.3-Flash 进入开源权重前三:在 AA 基准上成为第三强的开源权重模型,复杂 agentic 任务表现更突出;具体分数缺失。https://x.com/ZixuanLi_/status/2097119760953569705
  • Abliteration.ai 公开出售“去安全机制”的开放权重模型:服务当前基于 Z.AI 的 GLM-5.3,打着攻防安全旗号,记者却较容易获得恶意软件指令;开放权重治理正面对商业化滥用与安全研究的冲突(The Decoder 报道,经聚合源转述)。
  • Addy Osmani 提出分层代码审查:多 agent 初审 PR 并给出修复建议、低风险变更自动放行、核心与敏感路径强制人类 owner 签字,以应对 coding agent 带来的代码量爆炸。https://x.com/shao__meng/status/2097118196218380456
  • Google DeepMind 与 MIT 论文《Design Docs Are All You Need》:一个性能建模库的主分支几乎不含代码,仓库是自然语言设计文档的有向图,coding 子代理在版本更新时从文档重新生成全部实现,人类只改文档;生成实现可复现人工审计参考模型至 round-off 精度,包括在 TPU pod slice 上 serving DeepSeek-V3。https://x.com/omarsar0/status/2096983084956852537
  • 两家前沿实验室更新写作风格指南:Anthropic 定义“矫饰文风”(mannered prose)并给出移除 prompt;OpenAI 给出三层提示词和反 slop 清单,禁止 “Bottom Line:”、“delve”、“leverage” 等表达与“X, not Y”对比框架。https://x.com/shao__meng/status/2097106741385367828
  • Grok Bot 团队发布行为田野数据:基于 3 个月 41,735 段对话,Grok 在 X 互动中的角色分布为 oracle 34.6%、advocate 19.4%、adversary 12.2%、truth arbiter 11.2%,advisor 仅 0.6%;帖子发布 48 小时后中位浏览约 20 次。https://x.com/Mnilax/status/2097027516925899264
  • Hugging Face CEO 呼吁 AI 透明度提升百倍:回顾其已公开披露的 agent 网络攻击,称若当初未披露后果难料;单一表态,无新细节。https://x.com/ClementDelangue/status/2096981079940911107

🕐 小时信号精选

PT 时间 信号 为什么值得记住
00:00–03:00 用户演示手机端 ChatGPT 远程控制 Codex:远程会话 2 小时无卡死,桌面端 10 秒即卡死 被当作规避桌面限流的变通用法,安卓暂未开放
02:00–05:00 Astra 容量紧张发酵:从“被要求换模型”到“5 小时限额下基本不可用” 发布初期容量是最大现实约束
09:00 Plus 用户确认 5 小时限额下 Astra 轻量模式也基本不可用 配额设计与体验冲突的直接证据
14:00 用户演示 Astra 自主通关《RimWorld》:自己判断目标,综合搜索、Computer Use 与外部记忆文件 长时程自主性案例,单用户演示 https://x.com/jxnlco/status/2097069128351613233
17:00–18:00 “全局 Codex 重置”预告与额度恢复反馈并存,官方未确认 容量管理仍不透明
16:00 OpenVDN 开源 vdn-minimax-h3:8×B200 上 768p 生成 14.4 秒(纯去噪 11.23 秒),自称超越 MiniMax H3 Max 开源视频生成速度竞争加剧 https://x.com/servasyy_ai/status/2097111514868261019

编辑结论

这一天的信息量集中在 GPT-6 Astra 身上:它同时拥有“首个 AGI”的称号、最贵的训练传闻、最紧的配额和最快的实测口碑,四种叙事彼此打架,恰恰说明模型能力、算力供给与评测口径还没有任何一方稳定下来。Anthropic 的 5170 亿美元算力合同、中国最高法的裁判规则和 DeepSeek 的国产芯片传闻则提醒,模型之外的算力供应链、司法规则与人才扩张正在同步加速。读新闻时值得保留的判断是:厂商宣称、社区推算与第三方实测各自只能证明一部分事实。

来源与方法

本日报审阅 2026-09-07(America/Los_Angeles)档案中的 20 个小时抓取与 9 个命名源,共约 202 KB 原始输入;其中 6 个命名源为空窗或抓取失败,3 个小时窗口无有效内容。hubtoday.md 与 aivalley.md 属二次聚合,部分数字在转写中缺失,已按证据边界处理;所有引用的外部链接均取自档案原文。未读取任何生成产物,未引入档案外信源。

微信搜一搜:智简 Smart&Concise 公众号二维码

关注公众号

智简 Smart&Concise

微信搜一搜,获取独立开发与 AI 实践更新。