AI-List Daily — 2026-07-11 PT(周六)
> **方法说明**:本文件基于 `/Users/yangyilin/docs/ai-list/2026-07-11-pt/` 目录内全部 markdown 源合成(HH=00-00.md 至 HH=19-00.md 共 19 个小时文件 + aihot-morning.md 9 条精选 + hubtoday.md 23 条速读 + aivalley.…
方法说明:本文件基于
/Users/yangyilin/docs/ai-list/2026-07-11-pt/目录内全部 markdown 源合成(HH=00-00.md 至 HH=19-00.md 共 19 个小时文件 + aihot-morning.md 9 条精选 + hubtoday.md 23 条速读 + aivalley.md),daily.md 本身已被排除。daily.md不要求多源印证——单源高密度信号也独立保留。信号池结构说明:本日 5 个官方一手源(chrome-dev / claude-blog / cline-blog / google-research / openai-blog)全部为 RSS stub(130-226 字节),无新发布。aivalley.md 是 7-10 旧文 archive fallback(存档日期 2026-07-11 ≠ 实际文章日期 2026-07-10,撞题窗口打开)——本日报主动排除 aivalley 残留信号作为主题,仅在末尾“信号更新状态表”列出 hubtoday 中与 aivalley 残留相关的 9 条记录。xiaohu-ai.md 抓取失败(仅相对时间,无绝对日期元数据)。主要信号池 = aihot-morning.md 8.8KB(9 条真实新文)+ 19 个 HH-00.md hour 文件 + hubtoday.md 4.5KB 速读线索。
撞题协调:昨天
2026-07-10-pt/daily.md主题三 + top-story 选题 = “GPT-5.6 删盘事故 / 本地 Agent 安全”,本日不再展开同一主题(昨天已写深稿)。所有涉及本地 Agent 的信号仅作辅助引用,不独立成主题。
主题一:Harness 工业化已成 7 月共识主线,六位独立作者同日给出相同叙事
今天最强的架构信号不是单一产品发布,而是**“harness 是产品的下一层抽象”这条认知在六个独立作者的不同角度同时浮现。OpenAI 联创的同事账号 @Mnilax 转引 OpenAI 内部讲话:“every time you have to interact with the agent is a failure of the harness. If you’re babysitting it, the setup is doing its job wrong.” 同一日,AI 圈技术博主 @leopardracer 用 23 个❤️的故事记录一个独立开发者花 3 个月、18 小时每天手搓本地 agent OS,最后被 Anthropic 以“eight files and two hours of setup“的方式直接产品化——harness + constitution + trust ledger + goals folder + verifier loop 五件套打包成 weekend of config。响应这条叙事的,是响马 @xicilion 在 04:28 CST 给出的反向论述:“harness 的路径本身就是错误的。给模型打补丁的路径都是错误的,包括 skills。未来只有三个物种:模型、工具、流水线。没有中间态。”**
这三条把 harness 的张力拉到极致。中间还有两个独立来源:Lonely @Lonely__MH 23:13 CST 给出 GPT-5.6 Sol + Superpowers Skills 的实战失败报告——“GPT-5.6 Sol 模型本身已极强且高度 agentic,旧的 Skills 反而导致频繁误调用、上下文污染、token 暴增、左右脑互博、任务卡死”——并把“Skills 消亡”作为结论公开陈述(23:59 CST:“随着模型能力越来越强,或许我们将见证大部分 Skills 的消亡”)。LangChain CEO Harrison Chase @hwchase17 在 07:29 CST 用一条推文做了商业回应——“LangSmith does this for you. - in the cloud: LangSmith sandboxes - any model: LangChain integrates with 100s - harness: deep agents - tracing: langsmith observability - recursive improvement: langsmith engine”——把 LangSmith 的全部产品矩阵映射到 harness 哲学上。Gary Marcus 16:12 CST 给这场讨论钉上学术注脚:“loop engineering is: adding symbols to deep learning”——把 harness 与符号主义二十年的争论接上。
为什么这条信号今天值得单独成主线:六条独立论述覆盖了OpenAI 内部讲话 + Anthropic 产品实战 + 反向警示 + 商业平台对抗 + 学术回溯五个维度。不是“一家之言”,是**“harness 时代已成共识,下一步是路径之争”。Monimiy 转引的 OpenAI 原文最具诊断价值——它把 harness 定义从“产品功能”提升到“工程哲学层面:bad harness 的标志是用户必须介入,好的 harness 是”runs, checks itself, and pings you only when it’s stuck“。这是 Anthropic Skills 商店化、OpenAI Codex /deep agents 化、LangSmith harness-as-a-service 化的共同底层叙事。
来源:08-00.md 23:59 / 13-00.md 04:28 / 12-00.md 03:09 / 03-00.md 18:00 / 16-00.md 07:29 / 08-00.md 23:13 / 01-00.md 16:12。
源链接:
- OpenAI 内部讲话(via Mnilax):
https://x.com/Mnilax/status/2076020993819042300 - Anthropic 八文件 setup story(leopardracer):
https://x.com/leopardracer/status/2075882982053748959 - 响马反向论述:
https://x.com/xicilion/status/2076040979631714354 - Lonely GPT-5.6 + Skills 失败报告:
https://x.com/Lonely__MH/status/2075961669906485568 - Harrison Chase LangSmith 列单:
https://x.com/hwchase17/status/2076086628221960685
主题二:GPT-5.6 Sol 当日全线产品化,多个官方与第三方基准同日落到 Sol 一侧
如果只看一天,OpenAI 的 GPT-5.6 Sol 在 7-11 PT 周六完成了从“模型发布”到“产品矩阵落地”的全线推进。aihot-morning 收录的 Sam Altman @sama 推文给出医疗评估:最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。OpenAI Devs @OpenAIDevs 在 02:30-02:34 CST 集中放出 5 个第三方落地:NVIDIA 团队用 ChatGPT Work 自动化工作流、JetBrains 用 GPT-5.6 替代 Three.js demo、Figma Make 接入、Magic Patterns token efficiency 提升、Perplexity Agent API 上架。DeepSWE leaderboard 上 GPT-5.6 Sol 73% 第一名(02:32 CST 🔁 162 高转发)。同一小时 @sama 转引 @thsottiaux 推荐 Codex App,OpenAI Devs 单独一条 03:14 CST ❤️ 217 🔁 10 💬 27——是当天 OpenAI Devs 互动最高单推。
第三方验证这一侧,Sebastian Raschka @rasbt 在 00:35 CST 更新了他的 Pareto frontier 排名:把 Grok 4.5 与 Meta Muse Spark 1.1 加进去后说 “Grok 4.5 seems to sit at the Pareto frontier. Good bang for the buck. (Also added harness info)”——这把 harness 信息正式纳入独立研究者的多模型对比图。AI Leaders 里还有更早的 Greg Brockman @gdb 15:27 CST 亲自站台:“Sol for complex reasoning and data analysis:” ❤️ 123 🔁 5 💬 18——OpenAI 联创直接为 Sol 背书。Dan McAteer @daniel_mac8 18:26 CST 给出双向选择:“GPT-5.6 Sol vs. Fable 5—which is better? You don’t have to choose. Use both! GPT-5.6 Sol now available in fable-advisor.”——但更尖锐的是同一作者 23:17 CST 的 GPT-6 谣言:“GPT-6 rumors of a whale 10T param model need to be viewed in the light of the below report. GPT-6 may be a post-Mythos level model, with OpenAI’s world class post-training, at half the cost.”——这场 Sol 的胜利可能只是 GPT-6 之前的过渡窗口。
更值得注意的是 Lucas Beyer @giffmana(OpenAI 内部研究员)在 16:23 CST 给出的复盘:“Damn, should’ve also let Sol posttrain the Terra, not just the Luna, from the looks of it.”——这是 OpenAI 内部对 GPT-5.6 三个变体训练路径的事后反思,Terra 缺了 Sol posttrain 被认为是低估变体。配合响马的“未来只有三个物种:模型、工具、流水线”,这条信号把“模型层让位”与“模型层加速”两件事放进了同一时间窗。
为什么今天值得单独成主线:今天不是“又一个模型发布日”,而是**“GPT-5.6 Sol 从模型层跨进产品层 + 第三方独立基准 + 内部复盘反思”三件事同日发生**。Raschka 的 Pareto 图是过去 6 周最强独立第三方验证,Brockman 的亲自站台 + DeepSWE 73% 第一名把“agentic coding 默认模型”的标签钉死在 Sol 身上。
来源:11-00.md 02:30-03:14 / 00-00.md 15:27 / 09-00.md 00:35 / 08-00.md 23:17 / 03-00.md 18:26 / 01-00.md 16:23。
源链接:
- Sam Altman 医疗评估:
https://x.com/sama/status/2075985056846451123 - OpenAI Devs Sol 全线落地:
https://x.com/OpenAIDevs/status/2076022440187330990 - Sebastian Raschka Pareto 图:
https://x.com/rasbt/status/2075982283509571666 - Greg Brockman 站台:
https://x.com/gdb/status/2075844434063978724
主题三:Anthropic Fable 5 退订倒计时 + GLM-5.2 价格替代组合,把“模型层选择”重新变成 ROI 决策
Hesamation @Hesamation 在 14:00 CST(CST 5:51 = PT 14:00)给出了本周最锋利的成本对比:“this $8545 bill by Anthropic would be ~$1000 if you use GLM 5.2 from OpenRouter. and I really doubt Opus would be worth paying $7500 more when the subsidies are lifted.” 同一日 03:00 CST,他更早一条 ❤️ 11 推文把 Anthropic 的订阅定价逻辑拆穿:“Sir, if we pull Fable out of the subscription, our next best model is Opus 4.8 and even Grok beats that now, let alone GPT Sol. We’d be charging $200/month for third place.” 这两条把 Anthropic 当前 $200/月订阅的护城河撕开:Fable 5 拿掉以后,第二名 Opus 4.8 已经被 Grok 4.5 和 GPT-5.6 Sol 超越,订阅价值面临系统性重估。
第三方背书来自 Databricks 高管 Yuchen Jin @Yuchenj_UW 10:00 CST ❤️ 95 🔁 3 💬 38——他在同期给出独立经济判断:“As coding performance converges across AI labs and model sizes, does it still make sense to pay 5x to 10x more for a tiny bit of extra intelligence? Take GLM-5.2 vs. Fable 5. In 95% of tasks, most users cannot tell the difference. But they will definitely notice the bill.”——这是当日 AI Leaders 列表互动最高单推(除 Yann LeCun 的政治 RT 外)。雪踏乌云 @Pluvio9yte 在 07:00 CST 给出消费者侧信号:“讲个鬼故事,明天是 Fable 5 的最后一天”——Fable 5 在 Anthropic 订阅里的最后一天倒计时已经开始。
GLM-5.2 在同一天还有一条独立的开源信号:745B 参数 MoE 模型在 25GB 内存的普通消费级笔记本电脑上跑通。源出自 17:00 CST(PT 0:00)Geek Lite @QingQ77 的中文转引:“一个纯 C、零依赖的推理引擎,靠把 MoE 专家从磁盘流式读出来,让 25GB 内存的普通电脑也能跑 744B 的 GLM-5.2”(即 Colibri)。02:00 CST(PT 昨天上午 10 点)数字游民Jarod @jarodise 转引同一信号 🔁 78 高转发:“744B parameters. On a laptop. With 25GB RAM. Colibri runs GLM-5.2 (744B MoE) in pure C with zero dependencies. The trick: 把 21504 个路由专家放在磁盘上(约 370GB)按需流式读,只把稠密部分(约 17B 参数)用 int4 常驻内存(约 9.9GB)”——这是“GLM-5.2 ≠ 云端专属模型”的工程证据。
为什么值得单独成主线:今天三条信号放在一起构成一个完整叙事——Anthropic 订阅定价的护城河被拆穿 + 第三方独立经济判断 + GLM-5.2 在 25GB 笔记本上跑通证明替代方案不只是云端 API。当订阅里的旗舰模型不再是公认的“第一名”,且替代方案可在消费级硬件上本地部署,“模型层选择”就从“信仰”重新变成“ROI 决策”。
来源:14-00.md 05:51 / 03-00.md 18:41 / 10-00.md 01:03 / 07-00.md 22:34 / 17-00.md 08:56 / 02-00.md 17:03。
源链接:
- Hesamation $8545 对比 $1000:
https://x.com/Hesamation/status/2076061798902423582 - Yuchen Jin GLM-5.2 vs Fable 5 95% 任务无差:
https://x.com/Yuchenj_UW/status/2075989458412048813 - Colibri 25GB 跑 GLM-5.2:
https://x.com/QingQ77/status/2076108277364965737
主题四:Meta Superintelligence Labs 在 Alex Wang 一次“🥺“单推中启动,Muse Spark 1.1 把”视频端到端“作为开场
Alexandr Wang @alexandr_wang 在 13:00 CST(PT 21:00)发布了一条当日全网互动最高单推:❤️ 1.8K 🔁 54 💬 181——“um can’t we all be friends 🥺”。这条只有 6 个字的推文背后,是 Meta Superintelligence Labs 在 7-10 aivalley Barsee《OpenAI massive day》里预告、7-11 PT 正式软启动的招聘与生态协调。同一作者 04:11 CST “muse spark can serve all your particle playground needs” + 04:19 CST “ok the whale from muse spark 1.1 was a total surprise” ❤️ 139 🔁 4 💬 16 + 03:00 CST “muse spark is able to do end-to-end tasks based on short video instructions” ❤️ 91 🔁 9 💬 20——四条推文构建出 Muse Spark 1.1 的差异化:视频输入 → 端到端任务执行(不只是“看视频”,而是“看视频→生成代码”)。
Muse Spark 1.1 的独立第三方基准来自 aihot-morning.md 里 aivalley 7-10 旧文《OpenAI massive day》的字段:“Muse Spark 1.1 debuts as Meta’s advanced coding model: brings a multimodal reasoning model with a 1 million-token context window, advanced agent workflows, and stronger coding capabilities”——百万 token 上下文 + agent workflows + 强 coding。@teortaxesTex 进一步评测:“Muse Spark 1.1 is surprisingly close to Grok 4.5 on many high-signal evals. This is the current top on CritPT”(via @alexandr_wang 04:17 CST)。Hesamation 18:35 CST ❤️ 9 🔁 2 “you will love GPT-5.6 Sol when you look at these three charts next to each other”——同时给出三个独立基准图,但 Muse Spark 1.1 紧贴 Grok 4.5 的位置。
为什么值得单独成主线:Alex Wang 的 🥺 单推是当天全网互动最高一条,远高于一般模型发布推文。这是 Meta 在 SuperIntelligence Labs 名义下的第一次公开姿态(虽然措辞极其 soft)——招聘信号 + Muse Spark 1.1 视频端到端能力的同日发布,把 Meta 从“追赶者”位置重新推向“前沿挑战者”。配合 aivalley 7-10 残留的 “1X unveiled one of the most advanced humanoid robot hands” 25 自由度灵巧手 + “SpaceXAI and Cursor just launched Grok’s biggest upgrade yet” Grok 4.5 发布,7-10/7-11 是 Meta + SpaceXAI + 1X 三家 Musk 系前沿硬件/模型公司在 48 小时内连续布点——这是 aivalley 残留里值得拿出来作为“信号更新状态表”单独跟踪的一条。
来源:13-00.md 04:11 / 04:19 / 04:24 / 04:17 / 04:11(Alex Wang 五连推) / aivalley.md 7-10 残留 / 03-00.md 18:02。
源链接:
- Alex Wang 🥺 单推:
https://x.com/alexandr_wang/status/2076036790880755897 - Muse Spark 1.1 视频端到端:
https://x.com/alexandr_wang/status/2075883376037286023 - aivalley Meta massive day(7-10 旧文):
https://www.theaivalley.com/p/openai-massive-day
主题五:YC 总裁 Garry Tan 三连发“agent 时代”乐观论 + 同期反方声音,定义了 7 月的创业者情绪
Garry Tan @garrytan 是 Y Combinator 总裁,他在 7-11 PT 全天通过三条独立推文把“agent 时代”的乐观情绪推到全网最高互动水平。06-00.md 21:20 CST ❤️ 311 🔁 26 💬 78:“So much could go wrong. But the interesting question is always: what happens if things go right?”——这是当日 Garry Tan 互动最高一条,也是全天 AI 创业者乐观论的标志性单推。09-00.md 00:07 CST ❤️ 131 🔁 3 💬 28:“Make something agents want”——把 Paul Graham “Make something people want” 的经典创业箴言改写成 agent 时代版本。00-00.md 15:14 CST ❤️ 76 🔁 3 💬 8:“We are all just getting started”——给整个生态一个“不要停”的判断。
反方声音来自两位独立来源。Simon Willison @simonw 10-00.md 01:32 CST ❤️ 163 🔁 22 💬 30——“The idea of ‘AI employees’ feels so short-sighted to me - both disrespectful to humans and a complete misunderstanding of what these tools can do and how to best put them to work. You may as well start adding Excel spreadsheets to your org chart”。这是 AI Leaders 全天互动第二高的独立判断推文(仅次于 Alex Wang 🥺),反对“AI 员工作为组织架构单元”这个当前主流叙事。Yuchen Jin @Yuchenj_UW 13-00.md 04:17 CST ❤️ 65 🔁 3 💬 15 给出就业侧反向数据:“Counterintuitive truth: AI has created more jobs than it has destroyed so far. … It’s not AI replacing humans. It is humans with strong AI skill replacing humans without it.”——Databricks 高管用 OpenAI / Anthropic / Databricks 自己仍在扩招的事实支撑这个判断。
为什么值得单独成主线:今天不是 Garry Tan 一人发声,而是Garry Tan / Simon Willison / Yuchen Jin 三方在同一日给出三个不同立场的 agent 时代判断——乐观创业派 + 反对 AI 员工叙事派 + 实际就业正增长派。这是“agent 时代”在 7 月从 hype 进入 evidence 阶段的标志性一天:乐观仍然占主导(gdb ❤️ 123、garrytan ❤️ 311、rasbt 高转发),但反方开始用具体数字反驳(Yuchen Jin 95% 任务无差、Simon Willison 163 ❤️)。
来源:06-00.md 21:20 / 09-00.md 00:07 / 00-00.md 15:14 / 10-00.md 01:32 / 13-00.md 04:17。
源链接:
- Garry Tan “So much could go wrong”:
https://x.com/garrytan/status/2075933358660730901 - Simon Willison 反 AI 员工:
https://x.com/simonw/status/2075996740717871125 - Yuchen Jin AI 创造岗位:
https://x.com/Yuchenj_UW/status/2076038244513480765
主题六:GPT-5.6 Sol Ultra 一小时证明 50 年图论猜想,是 LLM 首次独立触碰“未解决数学问题”清单
aihot-morning.md 收录的 OpenAI 官方宣布,是今天最具备“行业里程碑”潜力的单一信号:GPT-5.6 Sol Ultra 模型在不到一小时内生成了图论难题“循环双覆盖猜想”的完整证明。该猜想由数学家 George Szekeres 和 Paul Seymour 于 1970 年代提出,悬而未决超过 50 年。模型通过调用 64 个并行子智能体及对抗智能体,在预留的 8 小时计算时间内仅用约 1 小时完成证明。OpenAI 已将证明及提示词以 PDF 形式发布。该证明尚未经同行评审,也未使用 Lean 等形式化工具验证。若通过验证,这将是 LLM 首次独立解决维基百科“未解决数学问题”列表中的难题。
这条信号与同期 Bun 重构 100 万行 Rust 代码(11 天 Claude Fable 5)放在同一周内——前者是“模型层的数学推理上限测试”,后者是“模型层的代码生成上限测试”。两个上限测试在同一周内同时出现,意味着旗舰模型的能力天花板在 7 月被持续推高。配合 Raschka Pareto frontier + DeepSWE 73% + Greg Brockman 站台——这不是某个实验室的独立事件,是整个行业在 7 月初同步进入“模型能力 → 实际产品价值”转换期。
为什么值得单独成主线:50 年未解猜想即使未通过同行评审,它改变了“LLM 不能独立做严肃数学研究”的预设。即使最终被推翻,“LLM 在 1 小时内给出 50 年猜想完整证明”这件事本身已经改变了 OpenAI、Anthropic、Google DeepMind 在数学方向的下一轮竞争策略。同时,“调用 64 个并行子智能体”——这是 agent-as-researcher 的早期范例,与主题一 harness 哲学同日共振。
来源:aihot-morning.md #4 / aihot-morning.md #7。
源链接:
- GPT-5.6 Sol Ultra 一小时证明:
https://www.ithome.com/0/975/646.htm - Bun 11 天 Fable 5 重构 100 万行:
https://www.ithome.com/0/975/469.htm
主题七:高价值单点(编辑判断 / 工程实践 / 信号线索)
下面这批信号无法独立成主题,但工程价值或叙事密度足够高,单独列出:
- Mesh LLM:开源点对点分布式 AI 计算项目,把多机 GPU/内存池化对外暴露 OpenAI 兼容 API,“Skippy”按层分区流水线支持 5 亿到 235B MoE 任意模型。18 MB 体积,启动后
localhost:9337/v1。这与 Anthropic 八文件 setup + LangSmith 列单形成“本地推理的工程轻量化”侧呼应。(来源aihot-morning.md#3) - Ghost Font 反 AI 字体:单帧截图无信息、视频片段才能解码,已确认 Claude Fable 和 GPT Sol 5.6 Ultra 即使具备编程能力也无法解码。这是 AI 视觉感知的硬基准——CAPTCHA 系统的下一代方向。(来源
aihot-morning.md#9) - 蚂蚁集团 Robbyant LingBot-VA 2.0:原生具身基础模型,因果 DiT 架构,13.0B 视频专家参数(1.9B 激活),训练 15.3B 参数,推理 2.5B 激活/token。RoboTwin 2.0 50 任务上干净与随机演示数据成功率分别达 93.8% 和 93.4%——单源但数据完整的具身基础模型发布。(来源
aihot-morning.md#2) - “every time you have to interact with the agent is a failure of the harness” — OpenAI 内部讲话全文,via @Mnilax。这条已上升为主题一核心证据,但作为单源引用价值极高。(来源
12-00.md03:09) - AI costs 2x every 45 days, productivity up 5% — Hesamation 07-00.md 22:54 CST ❤️ 7。这条把“AI 投入产出比”的怀疑推到量化层面:45 天成本翻倍,但 productivity 只增 5%——与 GPT-5.6 商业化 + harness 工业化叙事构成反向证据。(来源
07-00.md22:54) - Codex 的“everyone reports to tibo and tibo reports to everyone” — jason @jxnlco 23:37 CST ❤️ 123 💬 9。Codex 的组织哲学描述:所有 agent 都向 tibo(推测是团队领导 agent)汇报,tibo 向所有 agent 汇报——双向循环。这是 OpenAI 内部 agent 组织架构的工程描述。(来源
08-00.md23:37) - Loop engineering is: adding symbols to deep learning — Gary Marcus 16:12 CST ❤️ 21 🔁 1 💬 11。Marcus 借 harness 时代为二十年的符号主义争论翻案。(来源
01-00.md16:12) - LangChain LangSmith 完全产品矩阵对抗 harness 哲学 — Harrison Chase 07:29 CST。“harness: deep agents”是 LangSmith 直接对接 harness-as-a-service 的产品宣言。(来源
16-00.md07:29)
主题八:信号更新状态表(aivalley 7-10 残留 + hubtoday 速读)
aivalley.md 是 7-10 PT 旧文 archive fallback(撞题窗口打开)。按 §6e 范式,所有 aivalley 残留 6 条主线信号不展开为今日主题——它们在 7-10 daily.md 已写过。hubtoday.md 是次日 (7-12) 速读版(抓取目标日期 2026-07-12),仅作信号线索。
| aivalley 7-10 残留主线 | 是否在 7-11 二次出现 | 7-11 处理建议 |
|---|---|---|
| OpenAI ChatGPT Work 上线(GPT-5.6 + Slack/Teams/Drive/SharePoint/Salesforce) | 是(11-00.md 02:32 OpenAIDevs RT NVIDIA 用 ChatGPT Work) | 7-11 引用为二次确认,不独立成主题 |
| OpenAI GPT-Live 全双工语音模型 | 否(hubtoday 7-12 速读提到“短程多智能体合成”但未特指 GPT-Live) | hubtoday 7-12 跟踪 |
| GPT-5.6 Sol/Terra/Luna 三变体正式发布 | 是(11-00.md 02:30 DeepSWE 73% + 多方引用) | 已并入主题二 |
| Anthropic Claude reflection dashboard + 健康使用 | 否 | 无 7-11 新证据,跳过 |
| 1X NEO 25 自由度灵巧手(年产 10,000 只) | 否 | 跟踪 aivalley 7-12 是否回归 |
| SpaceXAI Grok 4.5 发布 + Cursor 上线 | 是(09-00.md 00:35 Raschka Pareto frontier + 03-00.md 18:35 Hesamation 对比) | Grok 4.5 已在主题二 / 主题三作为对比引用,不重复展开 |
| Meta Muse Spark 1.1 + Meta Model API | 是(13-00.md Alex Wang 四连推 + 主题四) | 已上升为主题四 |
| Reve 2.1 / Notion Ship OS / Ora Directory / Claude Cowork web&mobile | 否 | 7-11 无新证据,跳过 |
| OpenAI Atlas 关闭 + 浏览器野心继续 | 否 | hubtoday 7-12 跟踪 |
hubtoday 7-12 速读 23 条线索中,5 条是 7-11 PT 周六当天的真实信号(不是 7-12 内容):Bun 11 天百万行 Rust 重构、北京智源世界模型、Meta 智能指数 71.3 编码得分、Anthropic RAG 示例 47.9k Star、Garry Tan 持续转推 AI 政策。这 5 条已并入今日主线(主题一 / 主题二 / 主题五),不再单独展开。
🕐 每小时亮点追踪(PT 2026-07-11 周六)
按 SKILL.md §2 “小时文件必走” 规范。PT 当地时刻 = CST - 15 小时(PDT 期间)。
- PT 00:00 - 01:00(CST 15:00-16:00,周五深夜-周六凌晨):Greg Brockman @gdb 亲自站台 GPT-5.6 Sol ❤️ 123;Garry Tan “We are all just getting started” ❤️ 76;François Chollet 6 个月 agentic coding 大变化高转发 158。
- PT 02:00 - 03:00:Alexandr Wang Muse Spark “end-to-end tasks based on short video instructions” ❤️ 91 🔁 9;leopardracer 18 小时 × 90 天 vs Anthropic 八文件 setup ❤️ 23。
- PT 03:00 - 04:00:响马 harness 路径错误论;Max For AI 中国官媒用 GPT 生图 ❤️ 19;Hesamation “we’d be charging $200/month for third place” ❤️ 11。
- PT 06:00 - 07:00:Hesamation $8545 vs $1000 ❤️ 11;Garry Tan “So much could go wrong, but what if things go right” ❤️ 311 🔁 26(当日 Garry Tan 最高互动)。
- PT 07:00 - 08:00:Harrison Chase LangSmith 列单;GPT-5.6 删盘 Mac 文件事件(Gary Marcus ❤️ 11);Hesamation “AI costs 2x every 45 days, productivity up 5%”。
- PT 08:00 - 09:00:Lonely “Skills 消亡论” 💬 3;Lonely “GPT-5.6 + Superpowers Skills 实战失败” ❤️ 6 🔁 1;Alexandr Wang “whale from muse spark 1.1” ❤️ 139 🔁 4。
- PT 09:00 - 10:00:Garry Tan “Make something agents want” ❤️ 131 🔁 3 💬 28;Sebastian Raschka Pareto frontier 图 ❤️ 57 🔁 3 💬 7;jason 推 4 条 GPT-5.6 截图。
- PT 10:00 - 11:00:Simon Willison 反 AI 员工 ❤️ 163 🔁 22 💬 30;Yuchen Jin GLM-5.2 vs Fable 5 95% 无差 ❤️ 95 🔁 3 💬 38;高盛做多中国 AI 价值链分析。
- PT 11:00 - 12:00:OpenAIDevs Sol 全线落地 5 条;ℏεsam “MONITORING THE SITUATION” ❤️ 37。
- PT 12:00 - 13:00:Mnimiy 转引 OpenAI “every time you have to interact with the agent is a failure of the harness” ❤️ 19;OpenAIDevs 单推 ❤️ 217 🔁 10 💬 27。
- PT 13:00 - 14:00:响马 harness 路径错误;Alex Wang 🥺 单推 ❤️ 1.8K 🔁 54 💬 181(全网最高);Yuchen Jin AI 创造岗位 ❤️ 65。
- PT 14:00 - 15:00:Hesamation $8545 vs $1000 ❤️ 11;Maya 教练 + Anthropic 工程师 24 分钟 Claude Code 演示(Kanika 🔁 14);Kirk Borne 工程书推荐高密度。
- PT 16:00 - 17:00:Harrison Chase LangSmith harness 列单;Hesamation LinkedIn AI slop 评论 ❤️ 19。
- PT 18:00 - 19:00:Valve Opus vs GPT-5.6 Sol 对比图;GPT-6 10T 谣言;CUDA is ASI (Bojan Tunguz ❤️ 4)。
- PT 19:00 - 20:00:Opus vs GPT-5.6 Sol 雪踏乌云对比图 ❤️ 4;Harness as a Service (anorth_chen via Pluvio9yte 🔁 2);Harrison Chase “It’s just as much about the infra” 🔁 1。
- PT 21:00 - 22:00(cron 触发瞬间):当 cron 在 PT 21:00 触发时,HH=21 数据已抓取 5913 字节(Geek Lite 北京市山洪防御智能体 + Hesamation Grok 4.5 vs Opus 4.8 + leopardracer loop engineering + Garry Tan “Make something agents want” + AYi Grok 接入 Codex 蹭 Premium 价值)。
附:当日关键数字一览
- GPT-5.6 Luna 医疗评估成本 = GPT-5.5 的 1/25(OpenAI 自述)
- DeepSWE leaderboard GPT-5.6 Sol 第一名 73%(@datacurve via OpenAIDevs 🔁 162)
- GLM-5.2 744B MoE 在 25GB 内存普通笔记本电脑跑通(Colibri 纯 C 零依赖)
- Anthropic 实际账单 $8545 vs GLM-5.2 替代 $1000(Hesamation 14:00 ❤️ 11)
- GLM-5.2 vs Fable 5 95% 任务用户无差(Yuchen Jin ❤️ 95)
- Alex Wang 🥺 单推 ❤️ 1.8K 🔁 54 💬 181(当日 AI Leaders 全网最高)
- Garry Tan “things go right” ❤️ 311 🔁 26(当日 Garry Tan 单推最高)
- Simon Willison 反 AI 员工 ❤️ 163 🔁 22(AI Leaders 独立判断第二高)
- Yuchen Jin GLM-5.2 vs Fable 5 ❤️ 95 🔁 3 💬 38(Databricks 高管就业判断)
- GPT-5.6 Sol Ultra 1 小时证明 50 年图论猜想(未同行评审)
- Fable 5 在 Anthropic 订阅最后一天倒计时(雪踏乌云 22:34)
编辑后记:今天的信号密度异常高
7-11 PT 周六是一个信号密度异常高的周六——单日内含:1) OpenAI 官方宣布 GPT-5.6 Sol Ultra 证明 50 年猜想;2) Greg Brockman 亲自站台 + Raschka Pareto frontier 第三方验证;3) Anthropic Fable 5 退订倒计时 + GLM-5.2 价格对比双爆点;4) Harness 哲学在六位独立作者同日浮现;5) Meta Superintelligence Labs 软启动 + Alex Wang 全网最高互动单推;6) Garry Tan / Simon Willison / Yuchen Jin 三方 agent 时代判断同日发生。这六条主线放在一起构成了 7 月“harness 工业化 + 模型层竞争白热化 + 创业者情绪明确乐观”的三重信号同步——周末通常的“信号枯竭日”在今天没有出现。
但要注意:本日报5 个官方一手源全部 stub,没有 chrome-dev / claude-blog / cline-blog / google-research / openai-blog 的真实新文。日报主线全部依赖 aihot-morning.md(9 条精选)+ 19 个 HH-00.md + hubtoday.md 23 条速读。未来 7-12 PT 周日的官方源若仍为 stub,daily.md 必须用 §6c “信号更新状态表”格式继续处理残留,不强行展开新主题。