Qwen3.8-Max 首发 2.4T 参数、DeepSeek V4 Flash 重划定价线、OpenAI Astra 数学引争议
PT 2026-08-02 是被两件事压住的:开源阵营打出的两张新牌——Qwen 首次把 Max 级别模型下放为开源权重(2.4T 总参、95B 激活),DeepSeek V4 Flash 以"3 美分做 50 分"的价格把第二梯队拖入斩杀线;闭源阵营的动作相对克制,OpenAI 提前为下一代主力 Astra 放出数学十题与 200 页论文,但被学术界…
Qwen3.8-Max 首发 2.4T 参数、DeepSeek V4 Flash 重划定价线、OpenAI Astra 数学引争议
PT 2026-08-02 是被两件事压住的:开源阵营打出的两张新牌——Qwen 首次把 Max 级别模型下放为开源权重(2.4T 总参、95B 激活),DeepSeek V4 Flash 以“3 美分做 50 分”的价格把第二梯队拖入斩杀线;闭源阵营的动作相对克制,OpenAI 提前为下一代主力 Astra 放出数学十题与 200 页论文,但被学术界和圈内观察者批为“无对照组”的 PR,Grok 视频与 Anthropic Claude Code 子代理玩法占据产品侧叙事。三个主题决定了今天的时间线,配套的工程、经济、媒体三个维度同步发生结构性变化。
主题一:Qwen3.8-Max 把 Max 级模型下放到开源
Qwen 在 PT 19:00(北京时间 08/03 10:00)正式发布 Qwen3.8-Max,是 Qwen 家族迄今最强的模型,2.4T 总参数、95B 激活,开放权重将于下周发布(来源:aihot-morning.md,Qwen 官方博客 https://qwen.ai/blog?id=qwen3.8)。在 11-00.md 时间窗内,Yuchen Jin 总结为“第二个 >2T 的开源权重模型,仅次于 Kimi K3”,并暗示开源协议“希望是 MIT”。
这标志着 Qwen 第一次开放 Max 级权重。Hubtoday(hex 2077)同期给出 Thinking Machines 120 亿激活、原生文图音、B300 单卡可跑的同档开源模型作为参照;阿里与南大提出的流式音视频框架(锚点记忆压制长视频漂移,三卡可达 35 帧)也出现在同一窗口;两者与 Qwen 共同说明一件事:开源前沿不再只是“补缺”,而是直接进入“权重对等”区段。
社区当天对 Qwen3.8-Max 的实操反应集中在两条线。一是 @RileyBrown 把模型写进 agentnative_ 的“Huge Model Release: Qwen 3.8 Max”清单里作为测试目标;二是 @lxfater 与 @LufzzLiz 等用户表示要立刻跑分。Qwen3.8-Max 的定位在 aihot 摘要里被直接写作“开源最强编码与协作模型”,这一表述把“编码”和“协作”两个语义挂在 Max 级别上——后者比前者少见,指向 Anthropic、OpenAI 的 agent loop 正在被开源阵营追平。
需要注意的边界:2.4T / 95B 激活的具体架构(MoE 专家数、路由策略)、推理时的显存与吞吐、开放权重的协议(MIT 还是受限商用),目前只在厂商博客与二手转述中出现,独立 benchmark 还没公开。今天的 X 情绪集中在“开放权重第一阵营成型”,尚未触及它在代码、长上下文、Agent 实际工作流中的真实差距。
源链接:
主题二:DeepSeek V4 Flash 把“按 token 计价”打成“按任务计价”
今天时间线最热闹的不是 Qwen,而是 DeepSeek V4 Flash 的定价截图与“斩杀线”图(06-00.md、18-00.md)。@AYi_AInotes 的传播版本给出三个数字:DeepSeek V4 Flash 0731 智能指数 50、单任务成本 3 美分(缓存命中接近白送)、284B 总参 / 13B 激活 / 1M 上下文;GPT-5.6 Luna 比它贵 60%,缓存命中情况下便宜 98%。Cline 在 12-00.md 给出横向定位:5 个月前 Artificial Analysis Intelligence Index 第一名是 GPT-5.4 xhigh 的 51 分,本周 V4 Flash 已经 50 分,并指出 r/LocalLLaMA 在 M2 Ultra 上本地运行 V4 Flash 已成事实;Cline 进一步预测“本地模型在两年内成为多数派选择”。@geekbb 在 19-00.md 给出官方 Cache Read 价格对照:DeepSeek 中国官方的 Cache Read 比第三方 $0.028 的报价便宜相当大一截。@omarsar0 在 04-00.md 给出实操建议:“在 DeepSeek harness 发布前,先在 Pi harness 上跑 V4 Flash。”@indie_maker_fox 在 18-00.md 把这一套接进 OpenCodex:日常小任务走 DeepSeek,硬骨头丢给 GPT。
产品侧衍生出一件具体事:北京 AGI Bar 从 PT 13:30(06-00.md)起,把店内 Wi-Fi 默认带上 DeepSeek V4 Flash 的 API Token,进店即可不限量使用,Base URL/API Key 直接填进 Claude Code、Codex、Cursor、Cherry Studio。Max For AI 把这件事概括为“AI 推理从订阅商品变成水电一样的基础设施”。@huangserva 在 07-00.md 给出的反应是:“以后 OPC(one-person company)都直接到酒吧工作了?”
同时间窗的另一条线(@shao__meng)把视角切换到 Agent 经济学:在 Agent 阶段,“单任务成本”而非“单 token 成本”才是定价锚点——chatbot 是单轮,input/output 可以被人为限制;agent 是多轮 loop,token 用量随任务规模自然放大。DeepSeek V4 Flash 直接把单任务成本打到美分级,是 Agent 真正可大规模部署的临界点。@davis7 / @steipete 在 11-00.md、13-00.md 给出 Codex 上的具体配合方案:在 Codex 配置里把 multi-choice 工具允许在 plan mode 之外使用,“体感好 100 倍”。
证据边界:3 美分这个数字来自二手图表,AI Valley 在 18:00 提到的 V4 Pro 价格仍是 JP Morgan/路透社预测(“八月发布”),未官方化;@lxfater 在 06-00.md 把 V4-Flash 称为“现在性价比最高的模型”,@omarsar0 又补充“在 Pi harness 上极强”,可见不同 harness 下表现仍有差异。“缓存命中便宜 98%“是社区说法,没有官方文档可查。@huangserva 06-00.md 直接把这件事解读成”AGI Bar 在玩’文化下乡’“——视角极端,但反映出”基础设施级别的 API 出现在实体场景“这件事本身超出了大多数人的想象边界。
源链接:
- https://qwen.ai/blog?id=qwen3.8(对照点:Qwen 与 DeepSeek 同档开源节奏)
- https://www.theaivalley.com/p/anthropic-s-opus-5-is-almost-fable-5(AI Valley 的 V4 Pro 时间窗口判断)
主题三:OpenAI Astra 用十道数学题引战,方法学仍未公开
PT 19:00 之后,OpenAI 在博客与 249 页论文中宣布下一代主力模型的内部版本“解出 10 个数学/理论计算机科学悬而未决的问题”,最早一道 1964 年提出,最年轻的一道也躺了二十多年,分布在八个互不相关的分支(18-00.md,@xiaohu 转述)。@daniel_mac8 给出三项已知事实:用多 agent 处理长期任务、解决了 10 个开放问题、OpenAI 提供 reasoning walkthrough、能识别自身错误;Fable 自己评估“任何一道都够得上一枚 Fields Medal”。Greg Brockman 在 09-00.md 与 18-00.md 连发 GPT Work / Codex 的“教育工具”、“客户反馈转路线图”、“运营业务”三段 demo,把 Astra 与 ChatGPT Work 并联在一起讲。@gdb 09-00.md 单帖拿到 495 like / 22 RT / 61 回复——是当天 AI Leaders 列表里互动量最高的一条。
批评集中在 Gary Marcus 身上:他在 14-00.md、15-00.md、17-00.md、18-00.md、19-00.md 反复用“合成谬误”反驳——数学优势靠符号验证 + 廉价合成数据,是“可验证域”特例,不能外推到开放世界问题;OpenAI 既未给出方法细节,也没设置对照组。@dotcsv 在 08-00.md 把 Marcus 的反驳总结为“bar 一直在移动”。Marcus 在 19-00.md 进一步说“Astra 的解题证明本身写得很糟”、“不会解决现模型做不到的事”(比如从任意 PDF 中可靠提取数字、帮 Sabine Hossenfelder 写 YouTube 脚本),并暗示 OpenAI 用 Astra 转移“经济学越来越难看”的注意力。17-00.md 里他给出最有冲击力的一句:“BREAKING, Hysterical News: Half of the Astra problems can be solved Fable. OpenAI didn’t even have a control group.”
补充视角来自数学家端。@odysseus0z(15-00.md)从数学家视角加了一条更冷静的注脚——“模型还不懂数学品味,必须有人指方向,否则会产出大量真但无意义的定理”。@nlp_15_06 的 PHD 也表达过类似意思(转引于 Gary Marcus 14-00.md)。这条对 Astra 同样适用:能解出十道悬案不代表能选出值得解的悬案。
证据边界:OpenAI 没有公开解题所用方法、控制实验设置或训练细节;“识别自身错误”来自单一转述。Mathematica-like 工具是否被调用、Fable 是否真能复现一半的题目,结论未在公开渠道里复核。@omarsar0 14-00.md 给出更冷静的另一条对照:“跨我自己工作(AI + 生物研究)和相关爱好(音乐、赛车),0 个模型发布”——隐含的意思是模型在数学以外的扩散性突破还看不到。
源链接:
- https://garymarcus.substack.com/p/openais-amazing-but-vastly-oversold
- https://x.com/xiaohu/status/2084088697411244464(中文长摘要与原博客链接)
主题四:Anthropic Claude Code 从“工具”变“同事”,子代理成为产品叙事
18-00.md 同一窗口出现了两条与 Anthropic 强相关的转述。@xiaohu 转述 Boris 在 Anthropic 内部 Slack 的演示:Claude 主动接话,跨 Datadog 和 BigQuery 拉数据合成答案、参与设计讨论——形态是“长期目标 + Loop/Routines”,不是单轮 prompt。流程是这样的:他在反馈频道里随口吐槽一句音频图标难分,没 @ 任何人;Claude 自己冒出来接话,跨两个数据源查按钮使用频率、合数据、给替代方案;他让它画几版设计,它先回个画画的表情,接着真把草图画出来了;最后把设计师拉进来,变成多人对话。Boris 说这就是他心里“图形界面”该有的样子——不是静态文件系统,而是所有人都能参与、一直在变的对话。
Boris 另一段被广泛转述的话是:“Anthropic 内部平均 90% 的代码已经是 Claude Code 写的,他自己从去年 11 月起是 100%。“他把团队角色重新切为原型师 / 构建者 / 维护者 / 扩展者 / 收尾人五类,并指出扩展者”特别抢手“。@yetone 在 03-00.md 给出横向对照:他也在用 Coding Agent 写自己的 Agent Sandbox 和调度器,“确定性比较高,特别容易跑 lossless feedback loop”,Waterm 的内存占用被他压到 50MB 以下。@Vikingmute 在 07-00.md 给出方法层面的另一条补充:“长时间在同一个 session 里拉扯会污染上下文,“handoff 到新 session 后效果不一样;更稳的做法是让多个模型并行改 bug,开 worktree,最后由主模型比较并 reconcile。”
把这两段放在 OpenAI Codex 的同期叙事里对照:02-00.md、03-00.md、18-00.md 里大量 Codex 子代理配置(luna-worker.toml、gpt-5.6-luna + reasoning effort max)和 Anthropic Claude Code 的“五个角色”是同一波范式——AI 直接接管流程并切分工种。@Lonely__MH 02-00.md 把子代理适用场景压缩成五类:定向搜索代码与资料、并行检查测试/安全/质量、边界明确的小型修复、整理日志文档调研、批量处理重复性任务——这是社区层面已经收敛的用法说明。
证据边界:90% / 100% 来自单一创始人级别讲话,未公开代码仓使用统计;“扩展者抢手”也是同一来源。“五层 bug 诊断图”(leopardracer 在 07-00.md)由 Anthropic 一名工程师挂在 X 上,并不是新发布,但其传播说明这套心智模型正在被工程社区采纳。@Vikingmute 04-00.md 给出一句反向声音:“Luna Max 和 Sol Medium 之间还有挺大差距,本来它就是个更小的模型——你给它极详细的 prompt,结果勉强过得去,速度也更慢”,说明“用 Luna Max 替代 Sol Medium”是社区愿望而非稳定结论。
主题五:Google TPU 第八代拆成训练与推理两条产品线
01-00.md 复盘了 Google 第八代 TPU 的官方变动:上一代单芯片包打天下,这一代拆成 TPU 8t(训练)和 TPU 8i(推理)两颗。一组 9600 颗 TPU 8t 提供 121 exaflops 算力、2 PB 共享内存,峰值性能是上一代的 3 倍;TPU 8i 专门做后训练 + 实时推理,目标把通信密集型任务的延迟最多降一半。拆分理由和 Agent 时代强相关——Agent 多轮思考的累积延迟在单芯片架构上无法消化,训练要“能一次吞下海量数据慢一点无所谓”,推理要“反应快、问一句立刻答”。
证据边界:121 exaflops / 2 PB / “延迟最多降一半”是 Google 自己披露的指标,未与 NVIDIA Blackwell 或 Trainium 3 做对照基准。今天没有第三方对 8t/8i 的实测吞吐或能效比数据。
源链接:
主题六:Hugging Face CEO 现身主流媒体,定调“AI 网络安全的解药是 AI”
Clement Delangue 周末登上 CBS《Face the Nation》(09-00.md、11-00.md 多次转述),核心论点是:最近由 agent 发动的网络攻击让大家更关注 AI 风险,但“把发布节奏压下来并不管用、把能力集中在几家手里更糟”——只有用 AI 武装防御方(特别是开源模型)、强制 trace sharing 与事件披露、保留对 agent 网络攻击的惩罚性条款,才能让 AI 把网络安全做得“根本性更强”。Hugging Face 自己用开源模型抵御了一次 AI 驱动的网络攻击,是这个论点的具体案例。他同时给政府一个建议:与其限制 AI 公司的发布节奏,不如把“开放模型 + 强制披露 + 惩罚性条款”做实——这是开源阵营第一次在主流美国媒体上系统地给出政策三件套。
证据边界:开源模型“防御 agent 攻击”的事件溯源到 X 转述,Hugging Face 的 blog 链接、攻击时间线、防御模型版本都未在抓取范围内被独立确认。@Hesamation 在 09-00.md 给出反向声音:“Hugging Face 作为最高调的网络攻击受害者,呼吁’加速’和’开源模型’;与此同期,’制造这些事件’的闭源公司以’放慢 AI 节奏’和’安全’的名义反对这两件事。”——是开源/闭源阵营在 AI 安全议题上的第一次正面对峙。
高价值单点
- MiniMax-H3 公开上线(19-00.md,官方账号):原小互预告的开放多模态视频模型正式发布,统一处理文图音视频,直接出带声音的成片,可商用。是少数明确给出“商业可用”边界的国产视频生成模型发布。@AYi_AInotes 23-00.md 给出的反向判断是:“Seedance 2.5 太贵,继续玩 Grok——Grok 15 秒 1080P 视频一次性抽卡直接出,体感比降智的 Seedance 2.0 好”,这是今天两条视频路线(Grok vs Seedance 2.5)的实操对比。
- OpenAI ChatGPT Chrome 侧边栏升级(06-00.md,@jxnlco):选中文字右键即可问 ChatGPT,并能引用当前打开的标签页和 YouTube 视频内容。Codex / Work 共享 skill 的呼声同步出现(10-00.md,@rileybrown)。
- Anthropic Opus 5 vs Fable 5 定价对比(aivalley.md):Viktor.com 的对照测试显示 Sol 在内部 agent 工作流上以 1/3 价格与 Fable 5 持平($33.55 vs $96.55),中位任务完成时间 66–82 秒对 129–151 秒;测试方为商业赞助方,结果不能独立复核。AI Valley 同一条 newsletter 还报道了 Cursor 推出“smart AI Router”、Sam Altman 借“奇点”叙事补安全叙事。
- Cursor → FFmpeg 赞助 → Elon 转发(01-00.md,@AYi_AInotes):Anysphere(被 SpaceX 600 亿美元收购)向 FFmpeg 核心开发者免费开放 Cursor 额度,FFmpeg 官方公开致谢。Elon Musk 转发形成话题。这条事件的主要价值是“AI 工具对开源基础设施的支持方式”从捐钱转向“给额度”——纯 C + 手写汇编 + SIMD 的项目,最有效的外部杠杆是 AI 编程辅助本身。
- AGI Bar(Beijing)店内免费 DeepSeek V4 Flash(06-00.md,@MaxForAI):见主题二。
- SkillSmith(Google DeepMind)(09-00.md,@omarsar0 转述):把模型权重视作 LLM 原生读取的额外模态,在推理时通过“指令引导的参数化合成”直接产出新 prefix 权重,把技能组合从训练任务移到推理时操作。
- Codex 子代理“luna-worker.toml”模板(02-00.md、03-00.md):用 Sol 当 orchestrator,把 gpt-5.6-luna + reasoning effort max 封装为子代理,由 Sol 拆任务与审代码,单元成本相对 Sol 直接调用显著降低。社区用例包括“启动三个 luna_worker 分别检查类型错误、失败测试、未使用代码”。
- Thinking Machines 开源模型(hubtoday.md):120 亿激活、原生文图音处理、已披露权重、B300 单卡可跑;细节源自 hex 2077 摘要,需对照原仓库确认。同一摘要还提到谷歌论文对“模型心智自认”做激活干预(移除拒答向量后得分升至、95 道题回答更近人类)、阿肯色团队的因果干预基准(多模态模型仍明显吃力)。
- NVIDIA 本地化资源合集 LLMs-local(03-00.md,@GitHub_Daily):把 Ollama / llama.cpp / vLLM / Open WebUI / Lobe Chat 等本地推理生态收齐,是个人部署大模型的事实清单。
- 硬件钱包固件审计呼声(07-00.md,@ohxiyu):借 coldcard 案例提醒全行业重新审查历史固件——非 AI 主线,但与“AI 攻防 + 供应链”语境相邻。
- 企业 AI 助理的“激进品牌投流”(18-00.md,@lifesinger 转述陈冕采访):Lovart / LibTV 每月广告投流 100–200 万元人民币,品牌投流 1000–2000 万元以上;“饱和式品牌投流”被作者描述为当下产品运营最优方式——单一观察,不构成行业结论。
- Anthropic 五层 Agent bug 诊断图(07-00.md,@leopardracer):Prompt → Context → Harness → Loop → Graph,“每一层包裹下一层,重写 prompt 之前先定位”。不是新发布,但被广泛传播。
- AI 编程对学习能力的反噬(03-00.md,@KanikaBK 转述 Anthropic 相关研究):52 名专业开发者分两组,给一个全新 Python 库;用 AI 的一组完成速度没更快,但课后测验低 17 个百分点(两个等级差距),调试能力下滑最严重;其中“只用 AI 解释概念”的人得分 65–86%,“让 AI 写一切、粘贴答案”的人得分 24–39%。
- Cloudflare Agents Week(09-00.md,@Cloudflare):围绕“云基础设施如何从面向人浏览器变成面向自主 agent”的存储、执行、安全原语讨论。这是基础设施层对 agent-native web 的第一次系统表态。
- Frontier open model 影响中心化风险(09-00.md,@omarsar0):开源前沿模型“改变了关于智能的对话,因为中心化原本要走向绝对灾难”——开源阵营对闭源模式的政策论点。
- 华为诺亚开源记忆层(hubtoday.md):把记忆从单个智能体解耦,三维结构保存状态与演化轨迹,双榜成绩对标前沿。
- Karpathy / AirLLM / Mole CLI 等开源周边:hubtoday 给出多条开源前沿动态(AirLLM 可在 4GB 显卡跑,Star 25.6k;Mole CLI 跨过 60k stars;karpathy 用 wing 检验生成能力)。
🕐 小时信号精选
| PT 时间 | 信号 | 为什么值得记住 |
|---|---|---|
| 02:00 (PT 16:00 CST) | Qwen3.8-Max 正式发布 | Qwen 首次把 Max 级权重下放 |
| 03:00 (PT 17:00 CST) | DeepSeek V4 Flash “斩杀线”图广泛传播 | 单任务成本压到美分级,定价权转移的象征 |
| 06:00 (PT 20:00 CST) | AGI Bar 把店内 Wi-Fi 接上 DeepSeek V4 Flash | AI 推理首次以“基础设施”形态进入线下空间 |
| 07:00 (PT 21:00 CST) | Anthropic 五层 Agent bug 诊断图扩散 | 工程社区把 Agent 失败模式收敛成心智模型 |
| 09:00 (PT 23:00 CST) | Greg Brockman 推 GPT Work / Codex demo | OpenAI 用 Codex/Work 解释 Astra 之外的产品方向;当天互动量最高单帖 |
| 09:00 (PT 23:00 CST) | Clement Delangue 登上 CBS《Face the Nation》 | 开源阵营首次进入主流美媒定调议程 |
| 10:00 (PT 00:00 CST) | 网友复述 Google 内部 LMChat 故事 | 创新者窘境的当代版,但来源是单条二手转述 |
| 12:00 (PT 02:00 CST) | Cline 把 DeepSeek V4 Flash 50 分与 GPT-5.4 xhigh 51 分并列 | 本地 1–2 年内成为主流选择的判断锚点 |
| 13:00 (PT 03:00 CST) | Hugging Face CEO 接受《Face the Nation》采访 | 见主题六 |
| 15:00 (PT 05:00 CST) | Gary Marcus 列出 Astra 的“八大误解” | Astra 讨论从“震撼”切到“无对照组”的临界点 |
| 18:00 (PT 08:00 CST) | Boris 谈 Anthropic 内部 90% 代码由 Claude Code 写 | 闭源阵营把“AI 写代码”叙事推到 100% 自用层面 |
| 19:00 (PT 09:00 CST) | MiniMax-H3 公开上线 | 国产多模态视频模型首次明确“可商用”边界 |
编辑结论
PT 2026-08-02 是开源前沿、定价压力、闭源数学争议三股力量同台的一天。Qwen3.8-Max 与 DeepSeek V4 Flash 共同把“前沿能力 + 可负担成本”的组合摆到桌上,给闭源阵营留下一个不太舒服的位置;OpenAI 的 Astra 试图把数学突破作为下一轮叙事支点,但被“无对照组 + 无方法细节”挡在原地;Anthropic 则用“Claude Code = 同事 / 90% 代码”把产品故事往工程文化里推进;Hugging Face 第一次在主流美媒上系统提出“开源 + 披露 + 惩罚”的 AI 安全三件套。证据边界仍集中在三件事:开源权重的真实差距、V4 Flash 价格的稳定性、Astra 方法学公开程度——这三件决定下周的时间线往哪边走。
来源与方法
审阅范围:2026-08-02 PT 21 份小时抓取(覆盖 15:00 CST 起到次日 11:00 CST)+ aihot-morning.md + aivalley.md + hubtoday.md。小时抓取来自 AI-List 与 AI Leaders 两个 X 列表,部分推文带视频/截图但文本未展开;hubtoday 提供的中文短摘要存在截断,引用时已尽量避开不可查细节。信号池为 rich:当小时池完整、aihot-morning 给到主条目、aivalley 与 hubtoday 提供独立二手交叉。主要限制是 hubtoday 多为一句话转述,部分数字(如 121 exaflops / 90% 代码)来自单一作者或厂商自述;单一社交帖(如 90% 由 Claude Code 写、AGI Bar 免费 API、58 美分定价等)均按单一来源处理。