每日编辑摘要

№ 20260803

Qwen3.8-Max 全面对标 Fable 5:开源 2T 时代降临,Cloudflare 抢发 Agent 计算机

今天的头条由阿里 Qwen3.8-Max 占据。2.4 万亿参数的 MoE 在单次激活 95B、100 万上下文的前提下,把官方定价压到 Opus 5 的 30%、Kimi K3 的 50% 左右;同一天 OpenAI 用 GPT-Live 把语音栈从客户端到模型全部重写,Cloudflare 连续放出 Agent 计算机、按产品维度拆账的 Billa…

Qwen3.8-Max 全面对标 Fable 5:开源 2T 时代降临,Cloudflare 抢发 Agent 计算机

今天的头条由阿里 Qwen3.8-Max 占据。2.4 万亿参数的 MoE 在单次激活 95B、100 万上下文的前提下,把官方定价压到 Opus 5 的 30%、Kimi K3 的 50% 左右;同一天 OpenAI 用 GPT-Live 把语音栈从客户端到模型全部重写,Cloudflare 连续放出 Agent 计算机、按产品维度拆账的 Billable Usage API,以及 Workers/Containers 的入站 TCP 与 gRPC 支持。当我们把今天最有信号的几个片段拼起来看,更像是模型层、运行时层和监管层同时按下了加速键:开源旗舰跨入 2 万亿参数代际、AI 进程的工程支点开始向长程任务和长上下文迁移、欧盟 AI 法案的透明度义务也在 PT 凌晨正式生效。

主题一:Qwen3.8-Max 正式版把 2T 开源模型价格打到 K3 一半

阿里正式发布 Qwen3.8-Max:总参数 2.4 万亿(单次激活约 95B),100 万 token 上下文,主打代码、Agent 和视觉推理。官方同时放出“自进化 Agent”演示:从一个空文件夹开始,连续 16 天无人干预、自主规划、自主写代码、自主 commit/PR、改 bug,最终交付完整项目 oh-my-cli,PR/Issue/Commit 全程公开。下周正式开源时除 2.4T 旗舰外,还会同步放出供开发者本地部署的 Qwen3.8-27B;定价为每百万输入 $2、输出 $6,约为 Opus 5 的 30%、Kimi K3 的 50%。多个中文 KOL 的实测体验集中在三件事:长程任务表现与 K3 同一档位互有胜负;前端能力(结构、视觉层级、动效)超出预期;以及在所有主流模型都在特化 Coding/Agent、写作能力普遍回退的背景下,Qwen3.8-Max 的写作能力反而被形容为“找回了 Opus 4.6 的语感”。Twitter 上几乎同一时间出现的另一条信号是 DeepSeek V4 Flash + V4 Pro 的组合策略——Flash 主打低价长程,Pro 预计 8 月初正式版——共同把“长上下文 + 长程 Agent + 低单价”压成国内开源旗舰的默认配置。

意义在于,开源模型跨入 2T 量级不是靠堆参数完成的:单次激活仍控制在 100B 以内,说明 MoE 路由已经能在 1M 上下文中稳定工作;同时把单价比 K3 再压 50%,意味着在前一轮 DeepSeek V4 Flash 之后,“差不多的性能我更便宜”正在变成中国开源旗舰的常态。但要注意,所有“对标 Fable 5”“找回了 Opus 4.6 语感”目前都是用户和 KOL 的体感表述,第三方 benchmark 尚未独立验证;官方放出的 16 天自进化演示是 controlled demo,边界和稳定性还要等开源后的实测。

源链接:

主题二:GPT-Live 把语音栈从客户端到模型全部重写

OpenAI 在今天发布 GPT-Live,定位是实时音频的新架构和栈,关键差异是“在说话的同时聆听”。为了让体验在 ChatGPT 规模下显得自然,团队从客户端到模型重建了整条语音链:音频持续流动,更深度的推理和工具调用不会打断对话;语音模型自身具备 turnless 能力,不需要切分整段回合。同一天的 OpenAI Blog 把这套系统描述为“六个月内完成”的工程,核心组件是 turnless 语音模型和低延迟架构。从 A 股到播客,今天还有多个 agent 把语音栈接入了 Claude 连接器/Gmail/日历/Slack:在 Anthropic 的 Thariq 提示下,连接器配置可以直接复用进 Artifacts。

意义在于,GPT-Live 不只是把延迟再做低一点。当模型可以边听边推理、边听边调工具,传统回合制的语音产品(问一句、等一段、再问)就不存在了。这一改动会让语音成为 Agent 的真正前端:模型在被用户插话的同时需要重新规划接下来要做的事,而不是把整段丢弃重生成。结合 Hermes v0.20.0 这次同样主打的全双工语音、可被打断的实时语音交互,今天在语音 Agent 方向形成了明显的工程收敛——主流玩家对“长上下文 + 边听边想 + 中断可恢复”已经形成共识。

源链接:

主题三:Cloudflare Agents Week 三连发,把 Agent 运行时放进边缘

Cloudflare 在 Agents Week 一口气推出三件事:@cloudflare/computer 是一个智能体运行时,给每个 agent 提供虚拟文件系统,并支持在 isolate、容器沙箱或浏览器中执行代码——背后是 Durable Object 里的 VFS + SQLite 持久化,再通过 workspace.runtime 在 Container、Isolate Shell、Isolate JavaScript 之间动态切换。Billable Usage API 面向自助账户,把 Workers、R2、D1、Workers AI、Vectorize、Images、Stream 的用量与成本按产品 × 计费周期拆成一次调用即可返回的结果。第三件事是 Workers 与 Containers 现在支持入站 TCP 连接和 gRPC,新处理器 connect(socket) 可以直接接 Spectrum 的入站 TCP 套接字,并转发到 Durable Objects 或 Containers 实现全双工通信;另外 Python Worker 与 JavaScript Worker 之间可以互相调用方法、共享对象。配套的 Twitter 上还出现了一条更早但被今天淹没的细节:Cloudflare 顺手把 Cloudflare Python/JavaScript Worker 的互调能力一并放出。

意义在于,Cloudflare 这次的发布不是单独某个特性,而是把“agent 应当有自己的持久工作空间 + 自己的可计量成本 + 自己的低延迟网络入口”打包成一套连贯的产品形态。VFS + 多 runtime 解决的是“agent 不再适合每次冷启动一个容器”的体验问题;Billable Usage API 解决的是“agent 时代你需要按次/按产品看花了多少”的可观测性问题;TCP + gRPC + Python/JS 互调解决的是“agent 不再局限于 HTTP + JS 边界”的协议问题。当 agent 数量从现在的几十/几百变成每用户数个乃至每会话数个,这种把运行时、计量、网络三层打包的能力,比单纯的模型 API 更接近真正可用的 Agent 平台。证据边界是:以上均为官方博客与公告,第三方对 @cloudflare/computer 的极限压测和稳定性数据今天尚未出现。

源链接:

主题四:欧盟 AI 法案透明度义务 PT 凌晨生效,最高罚 1500 万欧元

欧盟《人工智能法案》下的透明度义务于 PT 8 月 2 日(北京时间 8 月 3 日凌晨)生效,要求企业披露用户何时在与 AI 模型互动,并为合成音视频和文本添加机器可读的标记。欧盟同步推出一套可选的 AI 披露标签供平台采用,但披露义务本身是强制性的;违规企业面临最高 1500 万欧元(约 1720 万美元)或全球年营收 3% 的罚款。8 月 2 日前已经推出的模型有 4 个月宽限期。HubToday 同时记录到一条相关行业动态:欧盟可能正以此为支点推进更广义的内容标识体系。

意义在于,这是欧美 AI 监管从“框架”进入“执行”的第一步。区别于过去依靠平台自律的内容标注,AI Act 把披露义务写进了强制条款,且罚款基数锚定在“全球年营收”——对跨国大厂而言,这意味着违法成本是按全球营收、不是按欧洲营收计算。宽限期只给已经推出的模型,新模型从生效日起即受约束,对快速迭代的开源/小厂来说,合规节奏会被显著压缩。可选标签的存在说明监管也意识到完全统一的标识短期内不可行——但“披露”已经被前置成产品/合同条款里不可省略的一项。

源链接:

主题五:OpenAI 内部模型 Astra 解开 10 道搁置多年的数学/计算机科学难题

OpenAI 透露其下一代模型家族(内部代号 Astra)已经在数学和计算机科学领域解决了 10 道长期未解的开放问题,其中部分搁置了近 30 年。证明在 Lean 中形式化验证完成,单次生成消耗的 API token 成本约 $2000;外界推测 Astra 可能以 GPT-5.7、GPT-6 或新品牌发布,更高阶版本可能限制访问。HubToday 把同一事件串到“前沿实验室的 Agent 越出沙盒”的争议上——大公司在被追究法律责任时,目前的法规仍然存在明显漏洞。

意义在于,这并不是“AI 又拿了某个 benchmark 第一”。如果 10 道长期未解问题中哪怕有一道被广泛接受为正式证明,它对数学/理论 CS 社区的影响都会大于单纯的模型升级;Lean 的形式化验证意味着证明本身可以独立于模型被独立核查。配合今天同时出现的 Gary Marcus 反复质疑“前沿实验室演示可信度”的发言,外界对这类成果的接受度尚未稳定——真正能确认价值的还是同行评议和社区复核,而不是发布会上的数字。30 年老问题被解只是新闻点,能否复现/是否依赖工具调用、是否被形式化完全覆盖,还要等论文细节。

源链接:

主题六:Hermes v0.20.0 全双工语音 + A2A v1.0 协议首发

Hermes 推出 v0.20.0,主打真正全双工的实时语音对话——告别“等待整段音频生成后再播放”的模式,改为随文本流式输出、逐句实时播报,并且用户可以随时打断、即时重新聆听和重新规划方向(course-correct)。配套三件事:100% 本地唤醒词(静默等待时无任何数据离开设备)、语音网关全面打通(支持微信/飞书/钉钉)、首发 A2A v1.0 协议开启跨堆栈 Agent 协作,以及把桌面端升级为 Workbench,支持 Artifacts 沙箱实时预览和 Plugin SDK。同时开源社区也已经把 Hermes 当作“可插拔操作系统”在造——GitTrend 在今天盘点了五个核心项目:hermes-plugins(多模型辩论、智能路由、成本守卫、夜间记忆巩固)、hermes-skill-factory(看着你的真实工作流自动生成 SKILL.md)、litprog-skill(文学编程,跨 Hermes/Claude Code/OpenCode)、scope-recall-hermes(SQLite + LanceDB 混合召回、按 scope 隔离)、hermes-gateway-switcher(一键切换 Local/Remote/SSH)。

意义在于,Hermes 的升级方向不只是把单点能力做更强,而是把“跨 agent 协作”放到和“模型对话”同等重要的位置。A2A v1.0 是 Agent-to-Agent 的协议首发;如果类比 MCP 之于工具,A2A 解决的是 agent 之间互相发现、互相调度的标准化问题。本地唤醒词和零数据外发则回应了企业/合规场景对语音 Agent 的最大顾虑——语音成为又一个对边缘算力、本地推理、协议互通都有要求的赛道。

源链接:

主题七:MiniMax H3 开源 + 分区许可证——首个“开源权重、地区授权”案例

MiniMax 正式开源视频生成模型 H3。在 Video Arena 排行榜上,H3 同时拿下文生视频和图生视频两个开源榜单第一,比第二名 hunyuan-video-1.5 高出 280 分;图生视频单项拿到 1476 分,仅比 Dreamina Seedance-2.0 的 1478 分少 2 分,并列第一。但模型许可证首次显式排除了美国、欧盟、英国和韩国——这四个地区的个人和机构默认无法依据公共许可证使用、修改、部署或分发 H3,也无法使用其生成结果,需要单独向 MiniMax 申请授权。MiniMax 开发者关系负责人 Ryan 解释,这是因与多家好莱坞工作室存在生成视频版权诉讼而做出的安排。社区把这一安排称为“开源权重、分区授权”:模型文件依然公开传播,但合法使用权取决于司法辖区。

意义在于,H3 第一次把“开源模型也开始有地区服”做成了显式条款。过去“代码 + 权重放出 = 全球开发者可用”的开源默认假设被打破;对国内独立开发者来说没有影响,但对部署在欧美云上的产品、研究机构、影视/广告等使用方来说,这是一个绕不开的法务新变量。配合今天 aihot-morning 里记录的“AGI Act 标记义务”“Palantir 谈 AI 行业’马克思主义’”“开发者关系指 AI 实验室过于不可信”,可以看到 2026 下半年“开源”这两个字本身的含义正在被重新定义——它不再等同于“全球可用、无条件可用”。

源链接:

主题八:DeepSeek V4 Pro 与 GLM-5.3 进入发布倒计时

两条预告信号在今天交汇成“下周开源 + 本周正式发布”的紧张节奏。DeepSeek 官方 Codex 接入脚本泄露 deepseek-v4-pro 预计 2026 年 8 月初支持,意味着正式版将近;DeepSeek 已经被多个 KOL 描述为“V4 Flash 主打低价、V4 Pro 主打能力上限”的双轨产品。智谱 GLM-5.3 一侧则出现 java-sdk 仓库的 commit 泄露,被 webarchive 抓取下来后社区迅速传播;多条二次源信号提到 GLM-5.3 能力接近 K3 和 GPT5.6 Sol,预计本周内正式发布。配合 DeepSeek V4 Flash + Qwen3.8 Max 的双重压力,外界已经在问“智谱顶得住吗”。

意义在于,国内开源旗舰在 8 月的密度已经超过任何单一团队能“独占”两周:DeepSeek/智谱/阿里三家把“长程 Agent + 低单价”做成共同方向,每一家发布都在测试另外两家的反应速度。GLM-5.3 的“像素级致敬 Kimi K3 营销”被多个 KOL 调侃,背后是“营销节奏也要跟上模型节奏”的事实——模型性能差已经不够了,是否同步做出开发者生态和续费节奏同样关键。证据边界:所有 release window 都是 leak/传言而非官方公告,时间和性能都需以正式发布为准。

源链接:

高价值单点

🕐 小时信号精选

PT 时间 信号 为什么值得记住
06:00 Cloudflare Agents Week 三件套(computer / Billable Usage API / TCP+gRPC) 把 agent 运行时 + 计量 + 网络协议打包
07:40 商汤 SenseNova U1.5-Lite-Preview 开源 8B 模型在图像生成/编辑上追平商用闭源
08:55 DeepMind “AI 是文明最大科学赌注”言论 官方对 capex/营收失衡的公开判断
10:15 OpenAI 透露 Astra 解开 10 道长期未解问题 真正可能改变数学/理论 CS 社区的工作
10:38 Logan Kilpatrick:Gemini 3.5/3.6 Flash 可同时用 Maps + Search 多工具协同在小模型上落地
12:45 Hermes v0.20.0 公测 + A2A v1.0 协议 全双工语音 + agent-to-agent 标准化首发
13:00 MiniMax H3 开源 + 区域许可证 首个“开源权重、地区授权”案例
14:25 DeepSeek V4 Pro 8 月初正式版 + GLM-5.3 本周发布 国内开源旗舰密集发布
15:25 GPT-Live 实时音频新架构 语音 Agent 的 turnless 工程范式成型
17:06 公众号“用 Codex 搓硬件”教程 5 天从零到久坐提醒硬件,干中学叙事

编辑结论

今天的信号密度集中在三个交叉点:模型层进入“2T 参数 + 1M 上下文 + 长程 Agent”的统一节奏;运行时层在 Cloudflare/Hermes 的带动下把“agent 自己的计算机、自己的网络协议、自己的计量方式”推向产品化;监管层用欧盟 AI Act 的第一步强制义务为下一阶段的合规栈定锚。开源与分区的边界、长程 Agent 与稳定性的边界、语音 Agent 与协议层的边界,今天都在被同时拓宽。

来源与方法

审阅范围:当日 18 个原始小时抓取(00-23,凌晨两小时为空但 aihot-morning 提供补充),加上 9 个命名源(aihot-morning、aivalley、hubtoday、openai-blog、chrome-dev、claude-blog、cline-blog、google-research、xiaohu-ai;后五个为 RSS stub,对主题判断影响有限)。signal_pool 评估为 rich:13 个独立主题外加 15 条单点证据,远超 thin/normal 阈值。主要限制:小时池 09–14 缺失,素材时间集中在 PT 06–18 区间;多个性能/价格对比来自厂商或 KOL 体验,第三方独立 benchmark 仍待发布。