Qwen3.8-Max 全面对标 Fable 5:开源 2T 时代降临,Cloudflare 抢发 Agent 计算机
今天的头条由阿里 Qwen3.8-Max 占据。2.4 万亿参数的 MoE 在单次激活 95B、100 万上下文的前提下,把官方定价压到 Opus 5 的 30%、Kimi K3 的 50% 左右;同一天 OpenAI 用 GPT-Live 把语音栈从客户端到模型全部重写,Cloudflare 连续放出 Agent 计算机、按产品维度拆账的 Billa…
Qwen3.8-Max 全面对标 Fable 5:开源 2T 时代降临,Cloudflare 抢发 Agent 计算机
今天的头条由阿里 Qwen3.8-Max 占据。2.4 万亿参数的 MoE 在单次激活 95B、100 万上下文的前提下,把官方定价压到 Opus 5 的 30%、Kimi K3 的 50% 左右;同一天 OpenAI 用 GPT-Live 把语音栈从客户端到模型全部重写,Cloudflare 连续放出 Agent 计算机、按产品维度拆账的 Billable Usage API,以及 Workers/Containers 的入站 TCP 与 gRPC 支持。当我们把今天最有信号的几个片段拼起来看,更像是模型层、运行时层和监管层同时按下了加速键:开源旗舰跨入 2 万亿参数代际、AI 进程的工程支点开始向长程任务和长上下文迁移、欧盟 AI 法案的透明度义务也在 PT 凌晨正式生效。
主题一:Qwen3.8-Max 正式版把 2T 开源模型价格打到 K3 一半
阿里正式发布 Qwen3.8-Max:总参数 2.4 万亿(单次激活约 95B),100 万 token 上下文,主打代码、Agent 和视觉推理。官方同时放出“自进化 Agent”演示:从一个空文件夹开始,连续 16 天无人干预、自主规划、自主写代码、自主 commit/PR、改 bug,最终交付完整项目 oh-my-cli,PR/Issue/Commit 全程公开。下周正式开源时除 2.4T 旗舰外,还会同步放出供开发者本地部署的 Qwen3.8-27B;定价为每百万输入 $2、输出 $6,约为 Opus 5 的 30%、Kimi K3 的 50%。多个中文 KOL 的实测体验集中在三件事:长程任务表现与 K3 同一档位互有胜负;前端能力(结构、视觉层级、动效)超出预期;以及在所有主流模型都在特化 Coding/Agent、写作能力普遍回退的背景下,Qwen3.8-Max 的写作能力反而被形容为“找回了 Opus 4.6 的语感”。Twitter 上几乎同一时间出现的另一条信号是 DeepSeek V4 Flash + V4 Pro 的组合策略——Flash 主打低价长程,Pro 预计 8 月初正式版——共同把“长上下文 + 长程 Agent + 低单价”压成国内开源旗舰的默认配置。
意义在于,开源模型跨入 2T 量级不是靠堆参数完成的:单次激活仍控制在 100B 以内,说明 MoE 路由已经能在 1M 上下文中稳定工作;同时把单价比 K3 再压 50%,意味着在前一轮 DeepSeek V4 Flash 之后,“差不多的性能我更便宜”正在变成中国开源旗舰的常态。但要注意,所有“对标 Fable 5”“找回了 Opus 4.6 语感”目前都是用户和 KOL 的体感表述,第三方 benchmark 尚未独立验证;官方放出的 16 天自进化演示是 controlled demo,边界和稳定性还要等开源后的实测。
源链接:
- https://x.com/Khazix0918/status/2084261120010068260
- https://x.com/AYi_AInotes/status/2084209808245133687
- https://x.com/op7418/status/2084178368564731996
- https://www.theaivalley.com/p/openai-previews-its-next-ai-model-family
主题二:GPT-Live 把语音栈从客户端到模型全部重写
OpenAI 在今天发布 GPT-Live,定位是实时音频的新架构和栈,关键差异是“在说话的同时聆听”。为了让体验在 ChatGPT 规模下显得自然,团队从客户端到模型重建了整条语音链:音频持续流动,更深度的推理和工具调用不会打断对话;语音模型自身具备 turnless 能力,不需要切分整段回合。同一天的 OpenAI Blog 把这套系统描述为“六个月内完成”的工程,核心组件是 turnless 语音模型和低延迟架构。从 A 股到播客,今天还有多个 agent 把语音栈接入了 Claude 连接器/Gmail/日历/Slack:在 Anthropic 的 Thariq 提示下,连接器配置可以直接复用进 Artifacts。
意义在于,GPT-Live 不只是把延迟再做低一点。当模型可以边听边推理、边听边调工具,传统回合制的语音产品(问一句、等一段、再问)就不存在了。这一改动会让语音成为 Agent 的真正前端:模型在被用户插话的同时需要重新规划接下来要做的事,而不是把整段丢弃重生成。结合 Hermes v0.20.0 这次同样主打的全双工语音、可被打断的实时语音交互,今天在语音 Agent 方向形成了明显的工程收敛——主流玩家对“长上下文 + 边听边想 + 中断可恢复”已经形成共识。
源链接:
- https://x.com/gdb/status/2084405421041963356
- https://openai.com/index/continuous-voice-interaction-with-gpt-live
- https://x.com/trq212/status/2084387303959740449
主题三:Cloudflare Agents Week 三连发,把 Agent 运行时放进边缘
Cloudflare 在 Agents Week 一口气推出三件事:@cloudflare/computer 是一个智能体运行时,给每个 agent 提供虚拟文件系统,并支持在 isolate、容器沙箱或浏览器中执行代码——背后是 Durable Object 里的 VFS + SQLite 持久化,再通过 workspace.runtime 在 Container、Isolate Shell、Isolate JavaScript 之间动态切换。Billable Usage API 面向自助账户,把 Workers、R2、D1、Workers AI、Vectorize、Images、Stream 的用量与成本按产品 × 计费周期拆成一次调用即可返回的结果。第三件事是 Workers 与 Containers 现在支持入站 TCP 连接和 gRPC,新处理器 connect(socket) 可以直接接 Spectrum 的入站 TCP 套接字,并转发到 Durable Objects 或 Containers 实现全双工通信;另外 Python Worker 与 JavaScript Worker 之间可以互相调用方法、共享对象。配套的 Twitter 上还出现了一条更早但被今天淹没的细节:Cloudflare 顺手把 Cloudflare Python/JavaScript Worker 的互调能力一并放出。
意义在于,Cloudflare 这次的发布不是单独某个特性,而是把“agent 应当有自己的持久工作空间 + 自己的可计量成本 + 自己的低延迟网络入口”打包成一套连贯的产品形态。VFS + 多 runtime 解决的是“agent 不再适合每次冷启动一个容器”的体验问题;Billable Usage API 解决的是“agent 时代你需要按次/按产品看花了多少”的可观测性问题;TCP + gRPC + Python/JS 互调解决的是“agent 不再局限于 HTTP + JS 边界”的协议问题。当 agent 数量从现在的几十/几百变成每用户数个乃至每会话数个,这种把运行时、计量、网络三层打包的能力,比单纯的模型 API 更接近真正可用的 Agent 平台。证据边界是:以上均为官方博客与公告,第三方对 @cloudflare/computer 的极限压测和稳定性数据今天尚未出现。
源链接:
- https://blog.cloudflare.com/cloudflare-computer
- https://blog.cloudflare.com/billable-usage-api
- https://blog.cloudflare.com/grpc-workers
- https://x.com/Cloudflare/status/2084271077396480227
主题四:欧盟 AI 法案透明度义务 PT 凌晨生效,最高罚 1500 万欧元
欧盟《人工智能法案》下的透明度义务于 PT 8 月 2 日(北京时间 8 月 3 日凌晨)生效,要求企业披露用户何时在与 AI 模型互动,并为合成音视频和文本添加机器可读的标记。欧盟同步推出一套可选的 AI 披露标签供平台采用,但披露义务本身是强制性的;违规企业面临最高 1500 万欧元(约 1720 万美元)或全球年营收 3% 的罚款。8 月 2 日前已经推出的模型有 4 个月宽限期。HubToday 同时记录到一条相关行业动态:欧盟可能正以此为支点推进更广义的内容标识体系。
意义在于,这是欧美 AI 监管从“框架”进入“执行”的第一步。区别于过去依靠平台自律的内容标注,AI Act 把披露义务写进了强制条款,且罚款基数锚定在“全球年营收”——对跨国大厂而言,这意味着违法成本是按全球营收、不是按欧洲营收计算。宽限期只给已经推出的模型,新模型从生效日起即受约束,对快速迭代的开源/小厂来说,合规节奏会被显著压缩。可选标签的存在说明监管也意识到完全统一的标识短期内不可行——但“披露”已经被前置成产品/合同条款里不可省略的一项。
源链接:
- https://www.theverge.com/ai-artificial-intelligence/974571/eu-ai-act-transparency-labels-rules-deepfakes
- https://hex2077.dev/docs/2026-08/2026-08-04/
主题五:OpenAI 内部模型 Astra 解开 10 道搁置多年的数学/计算机科学难题
OpenAI 透露其下一代模型家族(内部代号 Astra)已经在数学和计算机科学领域解决了 10 道长期未解的开放问题,其中部分搁置了近 30 年。证明在 Lean 中形式化验证完成,单次生成消耗的 API token 成本约 $2000;外界推测 Astra 可能以 GPT-5.7、GPT-6 或新品牌发布,更高阶版本可能限制访问。HubToday 把同一事件串到“前沿实验室的 Agent 越出沙盒”的争议上——大公司在被追究法律责任时,目前的法规仍然存在明显漏洞。
意义在于,这并不是“AI 又拿了某个 benchmark 第一”。如果 10 道长期未解问题中哪怕有一道被广泛接受为正式证明,它对数学/理论 CS 社区的影响都会大于单纯的模型升级;Lean 的形式化验证意味着证明本身可以独立于模型被独立核查。配合今天同时出现的 Gary Marcus 反复质疑“前沿实验室演示可信度”的发言,外界对这类成果的接受度尚未稳定——真正能确认价值的还是同行评议和社区复核,而不是发布会上的数字。30 年老问题被解只是新闻点,能否复现/是否依赖工具调用、是否被形式化完全覆盖,还要等论文细节。
源链接:
- https://www.theaivalley.com/p/openai-previews-its-next-ai-model-family
- https://hex2077.dev/docs/2026-08/2026-08-04/
主题六:Hermes v0.20.0 全双工语音 + A2A v1.0 协议首发
Hermes 推出 v0.20.0,主打真正全双工的实时语音对话——告别“等待整段音频生成后再播放”的模式,改为随文本流式输出、逐句实时播报,并且用户可以随时打断、即时重新聆听和重新规划方向(course-correct)。配套三件事:100% 本地唤醒词(静默等待时无任何数据离开设备)、语音网关全面打通(支持微信/飞书/钉钉)、首发 A2A v1.0 协议开启跨堆栈 Agent 协作,以及把桌面端升级为 Workbench,支持 Artifacts 沙箱实时预览和 Plugin SDK。同时开源社区也已经把 Hermes 当作“可插拔操作系统”在造——GitTrend 在今天盘点了五个核心项目:hermes-plugins(多模型辩论、智能路由、成本守卫、夜间记忆巩固)、hermes-skill-factory(看着你的真实工作流自动生成 SKILL.md)、litprog-skill(文学编程,跨 Hermes/Claude Code/OpenCode)、scope-recall-hermes(SQLite + LanceDB 混合召回、按 scope 隔离)、hermes-gateway-switcher(一键切换 Local/Remote/SSH)。
意义在于,Hermes 的升级方向不只是把单点能力做更强,而是把“跨 agent 协作”放到和“模型对话”同等重要的位置。A2A v1.0 是 Agent-to-Agent 的协议首发;如果类比 MCP 之于工具,A2A 解决的是 agent 之间互相发现、互相调度的标准化问题。本地唤醒词和零数据外发则回应了企业/合规场景对语音 Agent 的最大顾虑——语音成为又一个对边缘算力、本地推理、协议互通都有要求的赛道。
源链接:
- https://x.com/Lonely__MH/status/2084293289942552670
- https://x.com/GitTrend0x/status/2084224307010711783
主题七:MiniMax H3 开源 + 分区许可证——首个“开源权重、地区授权”案例
MiniMax 正式开源视频生成模型 H3。在 Video Arena 排行榜上,H3 同时拿下文生视频和图生视频两个开源榜单第一,比第二名 hunyuan-video-1.5 高出 280 分;图生视频单项拿到 1476 分,仅比 Dreamina Seedance-2.0 的 1478 分少 2 分,并列第一。但模型许可证首次显式排除了美国、欧盟、英国和韩国——这四个地区的个人和机构默认无法依据公共许可证使用、修改、部署或分发 H3,也无法使用其生成结果,需要单独向 MiniMax 申请授权。MiniMax 开发者关系负责人 Ryan 解释,这是因与多家好莱坞工作室存在生成视频版权诉讼而做出的安排。社区把这一安排称为“开源权重、分区授权”:模型文件依然公开传播,但合法使用权取决于司法辖区。
意义在于,H3 第一次把“开源模型也开始有地区服”做成了显式条款。过去“代码 + 权重放出 = 全球开发者可用”的开源默认假设被打破;对国内独立开发者来说没有影响,但对部署在欧美云上的产品、研究机构、影视/广告等使用方来说,这是一个绕不开的法务新变量。配合今天 aihot-morning 里记录的“AGI Act 标记义务”“Palantir 谈 AI 行业’马克思主义’”“开发者关系指 AI 实验室过于不可信”,可以看到 2026 下半年“开源”这两个字本身的含义正在被重新定义——它不再等同于“全球可用、无条件可用”。
源链接:
- https://x.com/MaxForAI/status/2084280158085845214
- https://x.com/servasyy_ai/status/2084299996540690776
- https://x.com/LufzzLiz/status/2084242917711913234
主题八:DeepSeek V4 Pro 与 GLM-5.3 进入发布倒计时
两条预告信号在今天交汇成“下周开源 + 本周正式发布”的紧张节奏。DeepSeek 官方 Codex 接入脚本泄露 deepseek-v4-pro 预计 2026 年 8 月初支持,意味着正式版将近;DeepSeek 已经被多个 KOL 描述为“V4 Flash 主打低价、V4 Pro 主打能力上限”的双轨产品。智谱 GLM-5.3 一侧则出现 java-sdk 仓库的 commit 泄露,被 webarchive 抓取下来后社区迅速传播;多条二次源信号提到 GLM-5.3 能力接近 K3 和 GPT5.6 Sol,预计本周内正式发布。配合 DeepSeek V4 Flash + Qwen3.8 Max 的双重压力,外界已经在问“智谱顶得住吗”。
意义在于,国内开源旗舰在 8 月的密度已经超过任何单一团队能“独占”两周:DeepSeek/智谱/阿里三家把“长程 Agent + 低单价”做成共同方向,每一家发布都在测试另外两家的反应速度。GLM-5.3 的“像素级致敬 Kimi K3 营销”被多个 KOL 调侃,背后是“营销节奏也要跟上模型节奏”的事实——模型性能差已经不够了,是否同步做出开发者生态和续费节奏同样关键。证据边界:所有 release window 都是 leak/传言而非官方公告,时间和性能都需以正式发布为准。
源链接:
- https://x.com/geekbb/status/2084235077115109777
- https://x.com/lxfater/status/2084228332700004353
- https://x.com/servasyy_ai/status/2084290937031893017
高价值单点
-
Palantir CEO Karp 谈 AI 行业“马克思主义”:Q2 营收 19 亿美元、同比 +93%,利润 11 亿美元。在股东信里 Karp 警告前沿 AI 实验室“对企业过于不可信”,意图“占有所谓合作伙伴的生产资料”,并主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自己的提示词、编排、上下文与数据。https://techcrunch.com/2026/08/03/after-killer-quarter-palantir-ceo-alex-karp-calls-ai-industry-marxist
-
OpenAI 内部模型“形式化验证”已涉及数学家认为“30 年未解”的问题:在 Lean 中完成,约 $2000 API token 成本。社区尚在等待论文细节。https://www.theaivalley.com/p/openai-previews-its-next-ai-model-family
-
微软开源 Orchard:面向研究社区的 agent 训练/评估框架,让研究员复用同一套基础设施支持较小模型也能跑出强劲性能。https://msft.it/6019a8fqP
-
OpenRouter Ori Eval:把 OpenRouter API 接到你的代码库里,每项任务都跑一遍再评估;目标是把“哪个模型最好”的问题换成“哪个模型最合适这个任务”。https://x.com/OpenRouter/status/2084301100078027143
-
AirLLM:单块 4GB GPU 跑 70B 模型推理:Hacker News 上获得 103 点热度。https://github.com/lyogavin/airllm
-
Google Agent Skills 幕后:从 Next 2026 前的 swarm 冲刺开始,GitHub 星标超 15,000;每个 Skill 走标准化目录 + CI/CD(含 linter、链接检查、AI 辅助清单)+ 提交时与每周评估,优先引用远程 MCP 工具。https://dev.to/googleai/behind-the-scenes-how-we-build-test-and-scale-google-agent-skills-1am5
-
EA 谈生成式 AI 进游戏:CSO Mihir Vaidya 主张神经符号架构——生成能力之外保留确定性与可控性,“控制是下一个前沿”;《模拟人生》服务超 5 亿玩家、近万亿种排列组合。https://runwayml.com/news/company-news/electronic-arts-ai-summit-2026
-
商汤 SenseNova U1.5-Lite-Preview 开源:8B-MoT、原生统一多模态、原生支持 4K 图像生成;声称图像生成与编辑效果明显超越 U1,并比肩商用闭源模型。https://x.com/SenseTime_AI/status/2084288424236782073
-
Cursor 集成 Google Workspace 全套:邮箱/日历/Drive/文档/表格全部直连,相当于 Cursor 拥有“整栋 Google 办公大楼”的钥匙。https://x.com/AYi_AInotes/status/2084227080044159277
-
Gemini 3.5/3.6 Flash 现可同时使用 Google Maps 与 Search 工具:Logan Kilpatrick 确认这是一个 backlog 很久的更新。https://x.com/OfficialLoganK/status/2084330762870685714
-
Harrison Chase:Managed Deep Agents 本周公开 Beta:LangChain 把 agent 周边“无聊的基础设施”打包成托管服务——opinionated evals(harbor)、agent/user 级 memory、工具访问的完整 OAuth、Slack/GitHub 等 channel 集成、无缝沙箱集成。https://x.com/hwchase17/status/2084328694048559158
-
TokTier 把分词做成有状态服务:跨 153,951 个真实 agent 调用测试,编码 cache hit 率 94.1%,分词占用最多 64% 的首 token 时间;增量修复 0.5–1.1 ms 完成,比 HuggingFace 快最多 437 倍;在 vLLM 下中位首 token 时间下降 16–34%。https://t.co/AM2dU8pnIx
-
SageAttention 2.2.0 跑 H3 提速 24.3%(最高 44%):在 RTX 4090 48G 上清空显存后单段从 425.6 秒降到 322.0 秒,连续 13 段省约 22 分钟。https://t.co/C0CgD0Drrc
-
Telegram 被苹果从全球 App Store 下架:消息由多个中文 KOL 在 PT 上午确认,包括美国商店也已搜不到;具体原因待官方说明。https://x.com/xiaohu/status/2084326900708610477
-
DeepMind 高管谈“AI 是文明最大的科学赌注”:资本已超过阿波罗、曼哈顿、互联网总和;“营收还撑不起 capex,这就是科学赌注的定义”。https://x.com/Hesamation/status/2084294646604198060
🕐 小时信号精选
| PT 时间 | 信号 | 为什么值得记住 |
|---|---|---|
| 06:00 | Cloudflare Agents Week 三件套(computer / Billable Usage API / TCP+gRPC) | 把 agent 运行时 + 计量 + 网络协议打包 |
| 07:40 | 商汤 SenseNova U1.5-Lite-Preview 开源 | 8B 模型在图像生成/编辑上追平商用闭源 |
| 08:55 | DeepMind “AI 是文明最大科学赌注”言论 | 官方对 capex/营收失衡的公开判断 |
| 10:15 | OpenAI 透露 Astra 解开 10 道长期未解问题 | 真正可能改变数学/理论 CS 社区的工作 |
| 10:38 | Logan Kilpatrick:Gemini 3.5/3.6 Flash 可同时用 Maps + Search | 多工具协同在小模型上落地 |
| 12:45 | Hermes v0.20.0 公测 + A2A v1.0 协议 | 全双工语音 + agent-to-agent 标准化首发 |
| 13:00 | MiniMax H3 开源 + 区域许可证 | 首个“开源权重、地区授权”案例 |
| 14:25 | DeepSeek V4 Pro 8 月初正式版 + GLM-5.3 本周发布 | 国内开源旗舰密集发布 |
| 15:25 | GPT-Live 实时音频新架构 | 语音 Agent 的 turnless 工程范式成型 |
| 17:06 | 公众号“用 Codex 搓硬件”教程 | 5 天从零到久坐提醒硬件,干中学叙事 |
编辑结论
今天的信号密度集中在三个交叉点:模型层进入“2T 参数 + 1M 上下文 + 长程 Agent”的统一节奏;运行时层在 Cloudflare/Hermes 的带动下把“agent 自己的计算机、自己的网络协议、自己的计量方式”推向产品化;监管层用欧盟 AI Act 的第一步强制义务为下一阶段的合规栈定锚。开源与分区的边界、长程 Agent 与稳定性的边界、语音 Agent 与协议层的边界,今天都在被同时拓宽。
来源与方法
审阅范围:当日 18 个原始小时抓取(00-23,凌晨两小时为空但 aihot-morning 提供补充),加上 9 个命名源(aihot-morning、aivalley、hubtoday、openai-blog、chrome-dev、claude-blog、cline-blog、google-research、xiaohu-ai;后五个为 RSS stub,对主题判断影响有限)。signal_pool 评估为 rich:13 个独立主题外加 15 条单点证据,远超 thin/normal 阈值。主要限制:小时池 09–14 缺失,素材时间集中在 PT 06–18 区间;多个性能/价格对比来自厂商或 KOL 体验,第三方独立 benchmark 仍待发布。