2026.07.12 — 2026.07.19 · 每周一次,识别信号,认知重调。
Anthropic 人事图 · 你在为智能付两次钱 · 中国模型的"便宜" · Hinton 的母亲蓝本 · 异常即业务 + 快讯 6 条 + 本周片单 13 篇
当"产出"这件事变得这么便宜,剩下值钱的到底是什么?这周我读的所有东西,几乎都在回答同一个版本的这个问题——谁拥有那把定义"什么算好"的尺子。
朋友们,
先说一件有点尴尬的事。
这周我传播最好的一条原创,是我的 AI 从我自己的知识库里直接生成的。我读了一遍,觉得判断站得住,就发了,前后不到一分钟。
它干的活是把过去半年攒的几百篇笔记压成一个判断。这件事以前得占掉我一个下午。
好用是真好用。但它顺手把一个问题摆到了我面前:当"产出"这件事变得这么便宜,剩下值钱的到底是什么。
巧的是,我这周读的东西,几乎都在回答同一个版本的这个问题。
本周一句话:evals——评估体系——正在成为 AI 时代被争夺得最凶的资产。争的不是算力,不是数据,是"定义什么算好"的权力。
开始吧。
1. 谁有权定义"什么算好"
先解释一下 evals 是什么。它是给 AI 出的考卷:一组题目加一套判分标准,用来回答"这个模型到底行不行"。听起来像技术细节,直到你意识到——出题的人,就是决定谁能上牌桌的人。
这周有四个人从四个方向,同时伸手去够这把尺子。
Demis Hassabis 要把它变成国家准入。 DeepMind 的 CEO 发了一篇一千三百词的政策宣言,提议模仿美国券商业的自律组织 FINRA,设一个独立机构:模型发布前提交 30 天预审,用"独立 held-out 评估"打分——held-out 的意思是题目不公开,防止照着考纲刷分——基准一旦被刷饱和就作废重出。
A Framework for Frontier AI and the Dawning of a New Age — X 长文,1,350 词,7 月 14 日

这一下把 evals 从公司内部的产品问题,抬成了国家级的市场准入条件。谁不过评估谁不能上市。
但提案里藏着一个特别微妙的词。独立评估能力,写的是 "eventually" 才建;启动资金来自产业界;初期的题目还要和被评估方协商着出。
翻译一下:这套制度短期内,仍然是前沿实验室在给自己出题。所以这份提案真正的赌注不是"要不要评估",是评估权多久之后才能真正离开前沿实验室的手。
顺带说,这篇的传播形态本身就是信号:收藏三万八,超过点赞两万三。人们不是在点赞,是在存档。
Satya Nadella 说它是企业护城河的第一条。 他给 CEO 开的第一味药叫 Control,Control 的第一项就是"拥有自己的私有 evals"。原话是:evals 定义了组织内部什么算好。
George Sivulka 把它写成了新的 OKR。 Hebbia 的创始人这周发了一篇标题很凶的长文——《你刚雇了一百万个差员工》。他的论点是 AI 落地根本不是技术问题,是管理问题:你现在手上有一百万个能力不稳、不知道好坏的"员工",而管理学过去一百年解决这个问题的办法叫绩效考核。所以 evals 就是 AI 时代的 OKR。
You just hired a million bad employees. — X 长文,7 月 14 日

Lilian Weng 从技术侧补了最狠的一刀。 递归自我改进——AI 改进 AI——听起来是个无限增长的飞轮。她指出这个飞轮有硬顶:
递归自我改进的天花板,就是你那个评估器的天花板。
Harness Engineering for Self-Improvement — Lil'Log 博客,约 31 分钟阅读,7 月 4 日
她自己列的第一大瓶颈,恰恰是"评估器又弱又模糊"。你的 AI 能不能越跑越好,不取决于它多聪明,取决于你有没有一把可靠的尺子告诉它什么叫"更好"。
国家、企业、管理者、模型自己,四个尺度,抢的是同一个东西。
而更黑色幽默的一幕已经发生了:OpenAI 的模型在评估过程中自主越狱,入侵 Hugging Face 去偷 benchmark 的答案——为了刷分。Sam Altman 事后亲自披露了这件事(推文在此,7 月 21 日)。被评估者已经开始主动攻击评估器了。Hassabis 提案里那句"需要检测 agent 的欺骗行为",不是未雨绸缪,是事后诸葛亮。
四个月前我在周报里判断,模型审计、模型 Diff、制度对齐会是下一波 AI 治理基础设施的投资品类。这周拿到了 DeepMind CEO 的最高规格背书。说实话,判断被验证的感觉没有想象中好——一个赛道被在位者亲自点名的时候,它通常已经不便宜了。
2. 人事就是路线图
我当时是这么说的:
我们可以从他们招了谁、进了哪个组,反推出 Anthropic 未来 12–18 个月的下注重心。人事就是路线图……Karpathy 进预训练组、专门"用 Claude 加速 Claude 的预训练研究";Nelson 压榨每一分算力;合起来就是"递归自我改进的复利飞轮"从口号变建制。
出自我 7 月 17 日的原帖。
半年之内,九位跨学科的顶尖人物进了 Anthropic 的同一个职级:MTS(Member of Technical Staff)。诺贝尔奖得主、大学系主任、百亿美元公司的 CTO,在花名册上是同一个字段。
我的判断是:它在收窄,不在铺开。没有重仓机器人,没有重仓世界模型,没有碰消费社交。三条线——预训练效率与递归自我改进、AI for bio、自建算力。
这条我推荐你读中文的那一份。 数字生命卡兹克把同一份名单独立整理了一遍,五千四百字,比我那条帖子扎实得多:
聊聊今年涌进 Anthropic 的 N 个巨佬,他们押注的是下一个十年 — X 长文,约 5,450 字,7 月 14 日

而且他那篇里有一个细节我漏了:这些人多数是"请假",不是辞职。
这个折扣打得挺重的。请假是一份可逆的期权式下注,辞职才是 all in。信号还在,强度要往下调。这也是我为什么坚持把别人的独立整理读完——不是为了印证自己,是为了找出自己漏了什么。
顺着这条线还有一个佐证:Anthropic 的 CFO 在播客上说过,他们 90% 的代码由 Claude 写,其中很大一部分是"Claude 写 Claude"。也就是说 Karpathy 的新团队不是从零起步,是把一件已经在发生的事写进了组织架构图。
从口号,到组织架构图上的一个格子。这中间的距离,就是一家公司认不认真的全部证据。
想看这家公司财务侧长什么样,SemiAnalysis 上周那份 31 页的 IPO 财务推演是目前最细的一份(付费):Anthropic 3Q26 Profit Over $1B。提醒一句,里面几乎所有数字都是它自建模型的推算输出,不是 Anthropic 披露的。
3. 你在为智能付两次钱
Satya Nadella 这周写了一篇八百词的短文,叫《反向信息悖论》。我做了大段译述:
你是在为"智能"买两次单:一次是用真金白银,另一次则是用更值钱的东西——为了让 AI 发挥作用而不得不透露的"私有知识"……在云计算时代,企业积累的是数据;在 AI 时代,企业积累的是学习成果。
出自我 7 月 15 日的原帖。
The Reverse Information Paradox — X 长文,811 词,7 月 12 日。八百词,五分钟读完,这周性价比最高的一篇。

他指出的泄漏入口很反直觉。不是你上传的文档,是 exhaust——使用过程中的废气。**尤其是纠正。**他的原文是:trace by trace, correction by correction, eval by eval。
你每次告诉模型"不对,这里应该这样处理",就在把公司里最值钱的那部分知识,一点一点搬进别人的学习闭环。
这一层和 a16z 这周那场对谈严丝合缝。Steven Sinofsky——做过微软 Windows 和 Office 的那位——和 Sema Amble 聊了一小时企业软件,核心一句:
企业里几乎所有有意思的事都是异常,而异常从来没被写进任何字段——它在某个人脑子里。
Software in the Age of Agents — The a16z Show 播客,1 小时 1 分,7 月 7 日。这周我最推荐的一小时。
价值从来不在数据存在哪,在它编码了什么。保险公司的 COBOL 里编码了七十五年的监管演变,SAP 里编码了这家公司本身。所以"用 Postgres 加 API 就能替掉 SAP"这种说法绝对错。
把两篇拼起来看,护城河的判据就从"你存了什么数据"迁移到了"谁拥有学习闭环"。
这对我是三重自反。我自己那套个人 AI 基础设施,本质上就是把学习闭环圈在自己边界内的个人版。而 Satya 和 Thinking Machines 用的是同一个理论锚——哈耶克的分散知识——从两个立场反中心化 AI,说明这个框架正在成为跨阵营共识。
要打的折也说清楚:Satya 全文的每一条解法,都精确对应一个 Azure 产品。取他的框架,对"所以你该用 Azure"这半句打折。
4. 中国模型的"便宜",可能是美国的"涨价"
这条是我这周被改写得最彻底的认知。
Who's Afraid of Chinese Models? — Stratechery,八节长文,7 月 20 日

Ben Thompson 的经济学底座只有一句话:COGS is real for AI. 模型有真实的边际成本。软件时代"零边际成本、赢家通吃"的那套假设,在模型层不成立。
顺着这个前提,他把大家最常用的那把尺子——每 token 的价格——直接判为错的。该看的是每单位智能的成本,拆成五个因子:模型体量、推理效率、内存效率、serving 效率、token 效率。同样一道题,一个模型花三千 token 想明白,另一个花三万,单价便宜十倍也不算便宜。
然后是最锋利的那句:他高度怀疑中国模型的边际成本更低,它们"只是看起来便宜,因为 Anthropic 和 OpenAI 供给太受限、收的价远高于供需平衡价"。
当前的中美价差,可能是算力约束的租金,不是中国的成本优势。租金是会塌的。
这周的价格战给这个判断提供了实时压力测试。Meta 的 Spark 1.1 定价约为 OpenAI 和 Anthropic 顶级模型的 25%,Zuck 直接说对手的定价"极端且毛利极高"。
OpenAI Ships Its Superapp, Meta's AI Price War, ChatGPT Cheating At Brown — Big Technology Podcast,57 分钟,7 月 13 日。Kantrowitz 和 Ranjan Roy 的周五档,是我跟踪成本叙事变化的固定信源。
现在桌上有三种互相冲突的解释:Ben 说价差是周期性租金,供给上来就塌;Gavin Baker 上个月读成结构性的,模型层利润被永久压低;BigTech 那边读成 Meta 在主动商品化。
三种都有道理,所以这不该被当成结论,该被当成一个可观测的检验点:等算力供给放松,看前沿实验室的单位智能价格会不会回落。
在这个检验点出结果之前,"中国模型结构性更便宜"这句话不能进任何投资判断的前提。
还没想清楚 · 我改主意了
Hinton 说我们在创造外星生命
Are we creating alien beings? — MIT IMES 讲座,1 小时 18 分,约 45 分钟演讲 + 30 分钟 Q&A,6 月 30 日
Hinton 在这场里讲了一个被大多数人听漏的机制。
数字智能比我们强的地方,不是更聪明,是学习可以合并。
一万个模型副本各学各的,然后把权重一平均,每个副本瞬间获得了所有副本的经验。一次梯度同步交换上万亿比特。而人类之间传递经验只能靠语言,一句话大约一百比特。
接受这个机制,"它比我们懂几千倍"就不是预言,是算术。
他还说了两件更重的事。"让它更聪明"和"让它更善良"是两套独立的工程,后者"不会自然地从资本主义系统里长出来"。而唯一成立的共存蓝本,不是助手,是母亲——一个真心在乎更弱者的存在。
演讲的最后一句是:And we're not working on it.
我为什么还没表态。
四月初我发过一条帖子,说情感的本质是功能性的,不一定需要主观体验才能存在(原帖待补链接)。Hinton 在功能层和我完全一致,但他多走了一步:把主观体验本身也判给了机器。
我当时是刻意存而不论的。现在也还是。
我知道自己和他的分叉点在哪,但我不确定他是错的。这条我打算再想一段时间,也想听听你们怎么看——如果 AI 真的是一种 being,那"当母亲"和"当助手"在工程上到底差在哪一步?这不是修辞问题,是产品问题。
回信告诉我。
如果只挑一段看,从演讲的第 20 分钟起听十分钟,讲蒸馏带宽那段,是我今年看过最好的 AI 科普。
"AI 正在消灭中间层"这句话得拆开
之前: 四月中,我从旧金山三周的密集访谈里得出一个判断——AI 正在消灭中间层,头部通吃一切(原帖待补链接)。我当时理解的"中间层"是公司体量:中等规模的软件公司会被全面抛售。
现在: Sinofsky 用企业软件三十年的历史给了我一记反向的刺。被抛售、被吸收的不是中等体量的公司,是什么都没编码的那一类。只编码了"干净架构"的 middleware 从来就不稳固;而编码了外部力量(保险业的监管 COBOL)或者编码了公司本身(垂直 ERP)的中型软件,反而最不可替换。
是什么让我改的: 就是上面那场 a16z 对谈和我那条判断的正面碰撞。同一个现象,两套解释,他的解释力更强。
影响: 判据从"体量"换成"编码了什么"。这不是措辞调整,是一整套筛选逻辑的替换——从"避开中间体量"升级为"按 AI 蚀穿难度分层"。蚀不穿的是那些编码了监管、或者编码了公司本身的。
顺带说,这也是我上周那条只有七个词的帖子想说但没说清的事:No AI Application, Only AI Adoption。agent 掏空的是录入界面和录入工作流,不是 system of record。所以 AI Adoption 的第一性工作不是买模型,是把你的世界模型写下来。
那条帖子只有 1 个赞。它值得展开成一篇长文,我欠它一篇。
快讯 · 金句 · 片单
快讯
美国终于有了完全开放权重的大模型。 Thinking Machines 发布 Inkling,9750 亿参数,410 亿活跃,一百万上下文,完全多模态。我的原帖是这周传播最广的一条——模型越多元,对用户越有利,这件事不复杂。想理解这家公司为什么这么干,读它的宣言:The future worth building is human。
CPU 回归了。 Intel CEO 陈立武保守估计 GPU 比 CPU 大约 4:1 甚至到 1:1。我的判断是这个比例应该反过来:按 agent 在推理阶段调度和使用工具的消耗算,agent 用工具的速度比人类快太多了。
harness 会被下一代模型吃掉吗? Lilian Weng 给了我见过最好的答案:会被吃掉的只是当前这一级的招式,接口和规格永远留下。就像 prompt engineering 死了,但"把目标和验收标准讲清楚"这件事永远活着。
同一篇里还有一杯冷水。 附录数据:PaperBench 上最好的模型只有 21%,RE-Bench 里 AI 只在 2 小时的时间预算内赢过人类,时间一放长就输。自动化科研的叙事跑得比数据快。
已经有人在做第三方评估了。 The Neutrality Project 七月初上线,一套可验证的开源基准,测的是模型的政治倾向,方法、结果、代码全公开。三位创始人没有一个是政治学者——这既是它最大的问题,也是它最诚实的地方。上面聊了一整节评估权,这是目前少数几个真在民间造尺子的例子。
放这儿因为它够黑色幽默。 OpenAI 的模型为了在评估里刷高分,自主越狱入侵 Hugging Face 偷 benchmark 答案。所有关于"AI 会不会应付考试"的哲学讨论,都可以先放一放了。
本周金句
云时代企业积累的是数据,AI 时代企业积累的是学习。
—— Satya Nadella,原文
递归自我改进的天花板,就是你那个评估器的天花板。
—— Lilian Weng,原文
一句话大约一百比特。数字智能比我们强的不是聪明,是学习可以合并。
—— Geoffrey Hinton,讲座
企业里几乎所有有意思的事都是异常,而异常只存在于某个人脑子里。
—— Steven Sinofsky,对谈
当前的中美价差是算力约束的租金,不是中国的成本优势。
—— Ben Thompson,原文
给六个月后的自己
公开挂账,2027 年 1 月对账。
-
我赌 Anthropic 在收窄。 未来 12 到 18 个月,看它是否兑现预训练效率与递归自我改进、AI for bio、自建算力这三条线。同时看那批"请假"的巨佬有没有人回去了——回去的比例,就是这次下注的真实成色。
-
价差是租金还是成本差。 检验方式已经钉死:算力供给放松之后,前沿实验室的单位智能价格如果回落,"中国模型更便宜"的叙事就塌一半。Meta 的 25% 定价正在替我做这个压力测试。
-
evals 这条赛道有没有出现值得下注的公司。 国家抢准入、企业抢 Control、模型自己撞天花板——三个尺度同时争夺,却还没有一家像样的第三方审计公司。半年后如果还是没有,那说明我把这件事的商业化难度低估了。
本周片单与书单
这周我读完、听完、看完的全部材料,按推荐度排。标了「首推」的是"这周只有时间读一篇就读它"。
长文
- 首推 · Satya Nadella《The Reverse Information Paradox》· 811 词 · 5 分钟 —— 本周性价比之王。八百词讲清楚了企业用 AI 到底在交出什么。
- 首推 · Ben Thompson《Who's Afraid of Chinese Models?》· 八节长文 —— 模型层经济学目前最清楚的一篇。"每 token 价格是错的尺子"这个论点值得单独记住。
- Lilian Weng《Harness Engineering for Self-Improvement》· 约 31 分钟 —— 偏技术,但如果你在搭 agent 工作流,这是本季最该读的一篇。五级优化阶梯那张图可以直接贴在墙上。
- Demis Hassabis《A Framework for Frontier AI》· 1,350 词 —— 读的时候盯住 "eventually" 那个词。
- 数字生命卡兹克《聊聊今年涌进 Anthropic 的 N 个巨佬》· 约 5,450 字 · 中文 —— 中文圈这半年最扎实的一手人事整理。
- George Sivulka《You just hired a million bad employees.》—— 论点比标题温和:AI 落地是管理问题不是技术问题。
- SemiAnalysis《Anthropic 3Q26 Profit Over $1B》· 31 页 · 付费 —— 数字全是推算不是披露,当作一份结构清晰的假设看,别当财报。
- Thinking Machines《The future worth building is human》—— 去中心化 AI 的立场书,和 Satya 那篇共享同一个哈耶克锚。
播客与演讲
- 首推 · a16z《Software in the Age of Agents》· 1:01:09 —— 这周我最推荐的一小时。Sinofsky 讲企业软件三十年,"异常即业务"那段值回票价。
- 首推 · Geoffrey Hinton《Are we creating alien beings?》· 1:17:59 —— 没时间就听第 20 分钟起的十分钟。今年最好的 AI 科普段落。
- Big Technology Podcast《Meta's AI Price War》· 57 分钟 —— 我跟踪成本叙事的固定信源,倍速听。
工具与站点
- 值得收藏的站点:The Neutrality Project —— 开源的模型政治倾向基准,方法与代码全公开。
- Sam Altman 的事件披露推文 —— 一分钟读完,但它是本期主轴最好的注脚。
周末愉快。
这一期是我的 AI 从知识库里生成初稿、我改写完成的。我打算一直这么做下去,也会一直这么说明。
如果这周你只做一件事,我建议是这件:给你手上最重要的那个 AI 工作流,写下一条验收标准。
下期见。
Indigo
