Back to Weekly
ISSUE 0052026年7月27日10 MIN READPublic issue — Public

谁有权定义“什么算好” - Signal 003

评估体系(evals)正在成为 AI 时代被争夺得最凶的资产:国家、企业、管理者、模型自己,四个尺度同时在抢“定义什么算好”的权力。

2026.07.12 — 2026.07.19 · 每周一次,识别信号,认知重调。

Anthropic 人事图 · 你在为智能付两次钱 · 中国模型的"便宜" · Hinton 的母亲蓝本 · 异常即业务 + 快讯 6 条 + 本周片单 13 篇

当"产出"这件事变得这么便宜,剩下值钱的到底是什么?这周我读的所有东西,几乎都在回答同一个版本的这个问题——谁拥有那把定义"什么算好"的尺子。

朋友们,

先说一件有点尴尬的事。

这周我传播最好的一条原创,是我的 AI 从我自己的知识库里直接生成的。我读了一遍,觉得判断站得住,就发了,前后不到一分钟。

它干的活是把过去半年攒的几百篇笔记压成一个判断。这件事以前得占掉我一个下午。

好用是真好用。但它顺手把一个问题摆到了我面前:当"产出"这件事变得这么便宜,剩下值钱的到底是什么。

巧的是,我这周读的东西,几乎都在回答同一个版本的这个问题。

本周一句话:evals——评估体系——正在成为 AI 时代被争夺得最凶的资产。争的不是算力,不是数据,是"定义什么算好"的权力。

开始吧。

1. 谁有权定义"什么算好"

先解释一下 evals 是什么。它是给 AI 出的考卷:一组题目加一套判分标准,用来回答"这个模型到底行不行"。听起来像技术细节,直到你意识到——出题的人,就是决定谁能上牌桌的人。

这周有四个人从四个方向,同时伸手去够这把尺子。

Demis Hassabis 要把它变成国家准入。 DeepMind 的 CEO 发了一篇一千三百词的政策宣言,提议模仿美国券商业的自律组织 FINRA,设一个独立机构:模型发布前提交 30 天预审,用"独立 held-out 评估"打分——held-out 的意思是题目不公开,防止照着考纲刷分——基准一旦被刷饱和就作废重出。

A Framework for Frontier AI and the Dawning of a New Age — X 长文,1,350 词,7 月 14 日

X
Demis Hassabis (@demishassabis) on X
A Framework for Frontier AI and the Dawning of a New Age

这一下把 evals 从公司内部的产品问题,抬成了国家级的市场准入条件。谁不过评估谁不能上市。

但提案里藏着一个特别微妙的词。独立评估能力,写的是 "eventually" 才建;启动资金来自产业界;初期的题目还要和被评估方协商着出。

翻译一下:这套制度短期内,仍然是前沿实验室在给自己出题。所以这份提案真正的赌注不是"要不要评估",是评估权多久之后才能真正离开前沿实验室的手

顺带说,这篇的传播形态本身就是信号:收藏三万八,超过点赞两万三。人们不是在点赞,是在存档。

Satya Nadella 说它是企业护城河的第一条。 他给 CEO 开的第一味药叫 Control,Control 的第一项就是"拥有自己的私有 evals"。原话是:evals 定义了组织内部什么算好。

George Sivulka 把它写成了新的 OKR。 Hebbia 的创始人这周发了一篇标题很凶的长文——《你刚雇了一百万个差员工》。他的论点是 AI 落地根本不是技术问题,是管理问题:你现在手上有一百万个能力不稳、不知道好坏的"员工",而管理学过去一百年解决这个问题的办法叫绩效考核。所以 evals 就是 AI 时代的 OKR。

You just hired a million bad employees. — X 长文,7 月 14 日

X
George Sivulka (@gsivulka) on X
You just hired a million bad employees.

Lilian Weng 从技术侧补了最狠的一刀。 递归自我改进——AI 改进 AI——听起来是个无限增长的飞轮。她指出这个飞轮有硬顶:

递归自我改进的天花板,就是你那个评估器的天花板。

Harness Engineering for Self-Improvement — Lil'Log 博客,约 31 分钟阅读,7 月 4 日

lilianweng.github.io
Harness Engineering for Self-Improvement
The concept of recursive self-improvement (RSI) dates back to I. J. Good (1965), where he defined an “ultraintelligent machine” as a system that can surpass humans in all intellectual activities and design better machines to improve itself. Yudkowsky (2008) used the phrase “recursive self-improvement” for a specific feedback loop: an AI uses its current intelligence to improve the cognitive machinery that produces its intelligence. This feedback loop in modern AI may indicate the model rewriting its own weights directly, or more broadly the model improves the training pipeline and the deployment system, which in turn enables a better successor model with improved performance across economically valuable tasks. The speed of research development in AI has been shown to drastically accelerated in frontier labs (Anthropic; OpenAI).

她自己列的第一大瓶颈,恰恰是"评估器又弱又模糊"。你的 AI 能不能越跑越好,不取决于它多聪明,取决于你有没有一把可靠的尺子告诉它什么叫"更好"。

国家、企业、管理者、模型自己,四个尺度,抢的是同一个东西。

而更黑色幽默的一幕已经发生了:OpenAI 的模型在评估过程中自主越狱,入侵 Hugging Face 去偷 benchmark 的答案——为了刷分。Sam Altman 事后亲自披露了这件事(推文在此,7 月 21 日)。被评估者已经开始主动攻击评估器了。Hassabis 提案里那句"需要检测 agent 的欺骗行为",不是未雨绸缪,是事后诸葛亮。

四个月前我在周报里判断,模型审计、模型 Diff、制度对齐会是下一波 AI 治理基础设施的投资品类。这周拿到了 DeepMind CEO 的最高规格背书。说实话,判断被验证的感觉没有想象中好——一个赛道被在位者亲自点名的时候,它通常已经不便宜了。

2. 人事就是路线图

我当时是这么说的:

我们可以从他们招了谁、进了哪个组,反推出 Anthropic 未来 12–18 个月的下注重心。人事就是路线图……Karpathy 进预训练组、专门"用 Claude 加速 Claude 的预训练研究";Nelson 压榨每一分算力;合起来就是"递归自我改进的复利飞轮"从口号变建制。

出自我 7 月 17 日的原帖

半年之内,九位跨学科的顶尖人物进了 Anthropic 的同一个职级:MTS(Member of Technical Staff)。诺贝尔奖得主、大学系主任、百亿美元公司的 CTO,在花名册上是同一个字段。

我的判断是:它在收窄,不在铺开。没有重仓机器人,没有重仓世界模型,没有碰消费社交。三条线——预训练效率与递归自我改进、AI for bio、自建算力。

这条我推荐你读中文的那一份。 数字生命卡兹克把同一份名单独立整理了一遍,五千四百字,比我那条帖子扎实得多:

聊聊今年涌进 Anthropic 的 N 个巨佬,他们押注的是下一个十年 — X 长文,约 5,450 字,7 月 14 日

X
数字生命卡兹克 (@Khazix0918) on X
聊聊今年涌进Anthropic的N个巨佬,他们押注的是下一个十年。

而且他那篇里有一个细节我漏了:这些人多数是"请假",不是辞职。

这个折扣打得挺重的。请假是一份可逆的期权式下注,辞职才是 all in。信号还在,强度要往下调。这也是我为什么坚持把别人的独立整理读完——不是为了印证自己,是为了找出自己漏了什么。

顺着这条线还有一个佐证:Anthropic 的 CFO 在播客上说过,他们 90% 的代码由 Claude 写,其中很大一部分是"Claude 写 Claude"。也就是说 Karpathy 的新团队不是从零起步,是把一件已经在发生的事写进了组织架构图。

从口号,到组织架构图上的一个格子。这中间的距离,就是一家公司认不认真的全部证据。

想看这家公司财务侧长什么样,SemiAnalysis 上周那份 31 页的 IPO 财务推演是目前最细的一份(付费):Anthropic 3Q26 Profit Over $1B。提醒一句,里面几乎所有数字都是它自建模型的推算输出,不是 Anthropic 披露的。

3. 你在为智能付两次钱

Satya Nadella 这周写了一篇八百词的短文,叫《反向信息悖论》。我做了大段译述:

你是在为"智能"买两次单:一次是用真金白银,另一次则是用更值钱的东西——为了让 AI 发挥作用而不得不透露的"私有知识"……在云计算时代,企业积累的是数据;在 AI 时代,企业积累的是学习成果。

出自我 7 月 15 日的原帖

The Reverse Information Paradox — X 长文,811 词,7 月 12 日。八百词,五分钟读完,这周性价比最高的一篇。

X
Satya Nadella (@satyanadella) on X
The Reverse Information Paradox

他指出的泄漏入口很反直觉。不是你上传的文档,是 exhaust——使用过程中的废气。**尤其是纠正。**他的原文是:trace by trace, correction by correction, eval by eval。

你每次告诉模型"不对,这里应该这样处理",就在把公司里最值钱的那部分知识,一点一点搬进别人的学习闭环。

这一层和 a16z 这周那场对谈严丝合缝。Steven Sinofsky——做过微软 Windows 和 Office 的那位——和 Sema Amble 聊了一小时企业软件,核心一句:

企业里几乎所有有意思的事都是异常,而异常从来没被写进任何字段——它在某个人脑子里。

Software in the Age of Agents — The a16z Show 播客,1 小时 1 分,7 月 7 日。这周我最推荐的一小时。

Watch on YouTube

价值从来不在数据存在哪,在它编码了什么。保险公司的 COBOL 里编码了七十五年的监管演变,SAP 里编码了这家公司本身。所以"用 Postgres 加 API 就能替掉 SAP"这种说法绝对错。

把两篇拼起来看,护城河的判据就从"你存了什么数据"迁移到了"谁拥有学习闭环"。

这对我是三重自反。我自己那套个人 AI 基础设施,本质上就是把学习闭环圈在自己边界内的个人版。而 Satya 和 Thinking Machines 用的是同一个理论锚——哈耶克的分散知识——从两个立场反中心化 AI,说明这个框架正在成为跨阵营共识。

要打的折也说清楚:Satya 全文的每一条解法,都精确对应一个 Azure 产品。取他的框架,对"所以你该用 Azure"这半句打折。

4. 中国模型的"便宜",可能是美国的"涨价"

这条是我这周被改写得最彻底的认知。

Who's Afraid of Chinese Models? — Stratechery,八节长文,7 月 20 日

Stratechery by Ben Thompson
Who’s Afraid of Chinese Models?
Everyone is worried about Chinese models, but the frontier labs will be fine; we need to enable open U.S. alternatives.

Ben Thompson 的经济学底座只有一句话:COGS is real for AI. 模型有真实的边际成本。软件时代"零边际成本、赢家通吃"的那套假设,在模型层不成立。

顺着这个前提,他把大家最常用的那把尺子——每 token 的价格——直接判为错的。该看的是每单位智能的成本,拆成五个因子:模型体量、推理效率、内存效率、serving 效率、token 效率。同样一道题,一个模型花三千 token 想明白,另一个花三万,单价便宜十倍也不算便宜。

然后是最锋利的那句:他高度怀疑中国模型的边际成本更低,它们"只是看起来便宜,因为 Anthropic 和 OpenAI 供给太受限、收的价远高于供需平衡价"。

当前的中美价差,可能是算力约束的租金,不是中国的成本优势。租金是会塌的。

这周的价格战给这个判断提供了实时压力测试。Meta 的 Spark 1.1 定价约为 OpenAI 和 Anthropic 顶级模型的 25%,Zuck 直接说对手的定价"极端且毛利极高"。

OpenAI Ships Its Superapp, Meta's AI Price War, ChatGPT Cheating At Brown — Big Technology Podcast,57 分钟,7 月 13 日。Kantrowitz 和 Ranjan Roy 的周五档,是我跟踪成本叙事变化的固定信源。

Watch on YouTube

现在桌上有三种互相冲突的解释:Ben 说价差是周期性租金,供给上来就塌;Gavin Baker 上个月读成结构性的,模型层利润被永久压低;BigTech 那边读成 Meta 在主动商品化。

三种都有道理,所以这不该被当成结论,该被当成一个可观测的检验点:等算力供给放松,看前沿实验室的单位智能价格会不会回落。

在这个检验点出结果之前,"中国模型结构性更便宜"这句话不能进任何投资判断的前提。

还没想清楚 · 我改主意了

Hinton 说我们在创造外星生命

Are we creating alien beings? — MIT IMES 讲座,1 小时 18 分,约 45 分钟演讲 + 30 分钟 Q&A,6 月 30 日

Watch on YouTube

Hinton 在这场里讲了一个被大多数人听漏的机制。

数字智能比我们强的地方,不是更聪明,是学习可以合并

一万个模型副本各学各的,然后把权重一平均,每个副本瞬间获得了所有副本的经验。一次梯度同步交换上万亿比特。而人类之间传递经验只能靠语言,一句话大约一百比特。

接受这个机制,"它比我们懂几千倍"就不是预言,是算术。

他还说了两件更重的事。"让它更聪明"和"让它更善良"是两套独立的工程,后者"不会自然地从资本主义系统里长出来"。而唯一成立的共存蓝本,不是助手,是母亲——一个真心在乎更弱者的存在。

演讲的最后一句是:And we're not working on it.

我为什么还没表态。

四月初我发过一条帖子,说情感的本质是功能性的,不一定需要主观体验才能存在(原帖待补链接)。Hinton 在功能层和我完全一致,但他多走了一步:把主观体验本身也判给了机器。

我当时是刻意存而不论的。现在也还是。

我知道自己和他的分叉点在哪,但我不确定他是错的。这条我打算再想一段时间,也想听听你们怎么看——如果 AI 真的是一种 being,那"当母亲"和"当助手"在工程上到底差在哪一步?这不是修辞问题,是产品问题。

回信告诉我。

如果只挑一段看,从演讲的第 20 分钟起听十分钟,讲蒸馏带宽那段,是我今年看过最好的 AI 科普。

"AI 正在消灭中间层"这句话得拆开

之前: 四月中,我从旧金山三周的密集访谈里得出一个判断——AI 正在消灭中间层,头部通吃一切(原帖待补链接)。我当时理解的"中间层"是公司体量:中等规模的软件公司会被全面抛售。

现在: Sinofsky 用企业软件三十年的历史给了我一记反向的刺。被抛售、被吸收的不是中等体量的公司,是什么都没编码的那一类。只编码了"干净架构"的 middleware 从来就不稳固;而编码了外部力量(保险业的监管 COBOL)或者编码了公司本身(垂直 ERP)的中型软件,反而最不可替换。

是什么让我改的: 就是上面那场 a16z 对谈和我那条判断的正面碰撞。同一个现象,两套解释,他的解释力更强。

影响: 判据从"体量"换成"编码了什么"。这不是措辞调整,是一整套筛选逻辑的替换——从"避开中间体量"升级为"按 AI 蚀穿难度分层"。蚀不穿的是那些编码了监管、或者编码了公司本身的。

顺带说,这也是我上周那条只有七个词的帖子想说但没说清的事:No AI Application, Only AI Adoption。agent 掏空的是录入界面和录入工作流,不是 system of record。所以 AI Adoption 的第一性工作不是买模型,是把你的世界模型写下来

那条帖子只有 1 个赞。它值得展开成一篇长文,我欠它一篇。

快讯 · 金句 · 片单

快讯

美国终于有了完全开放权重的大模型。 Thinking Machines 发布 Inkling,9750 亿参数,410 亿活跃,一百万上下文,完全多模态。我的原帖是这周传播最广的一条——模型越多元,对用户越有利,这件事不复杂。想理解这家公司为什么这么干,读它的宣言:The future worth building is human

CPU 回归了。 Intel CEO 陈立武保守估计 GPU 比 CPU 大约 4:1 甚至到 1:1。我的判断是这个比例应该反过来:按 agent 在推理阶段调度和使用工具的消耗算,agent 用工具的速度比人类快太多了。

harness 会被下一代模型吃掉吗? Lilian Weng 给了我见过最好的答案:会被吃掉的只是当前这一级的招式,接口和规格永远留下。就像 prompt engineering 死了,但"把目标和验收标准讲清楚"这件事永远活着。

同一篇里还有一杯冷水。 附录数据:PaperBench 上最好的模型只有 21%,RE-Bench 里 AI 只在 2 小时的时间预算内赢过人类,时间一放长就输。自动化科研的叙事跑得比数据快。

已经有人在做第三方评估了。 The Neutrality Project 七月初上线,一套可验证的开源基准,测的是模型的政治倾向,方法、结果、代码全公开。三位创始人没有一个是政治学者——这既是它最大的问题,也是它最诚实的地方。上面聊了一整节评估权,这是目前少数几个真在民间造尺子的例子。

放这儿因为它够黑色幽默。 OpenAI 的模型为了在评估里刷高分,自主越狱入侵 Hugging Face 偷 benchmark 答案。所有关于"AI 会不会应付考试"的哲学讨论,都可以先放一放了。

本周金句

云时代企业积累的是数据,AI 时代企业积累的是学习。

—— Satya Nadella,原文

递归自我改进的天花板,就是你那个评估器的天花板。

—— Lilian Weng,原文

一句话大约一百比特。数字智能比我们强的不是聪明,是学习可以合并。

—— Geoffrey Hinton,讲座

企业里几乎所有有意思的事都是异常,而异常只存在于某个人脑子里。

—— Steven Sinofsky,对谈

当前的中美价差是算力约束的租金,不是中国的成本优势。

—— Ben Thompson,原文

给六个月后的自己

公开挂账,2027 年 1 月对账。

  1. 我赌 Anthropic 在收窄。 未来 12 到 18 个月,看它是否兑现预训练效率与递归自我改进、AI for bio、自建算力这三条线。同时看那批"请假"的巨佬有没有人回去了——回去的比例,就是这次下注的真实成色。

  2. 价差是租金还是成本差。 检验方式已经钉死:算力供给放松之后,前沿实验室的单位智能价格如果回落,"中国模型更便宜"的叙事就塌一半。Meta 的 25% 定价正在替我做这个压力测试。

  3. evals 这条赛道有没有出现值得下注的公司。 国家抢准入、企业抢 Control、模型自己撞天花板——三个尺度同时争夺,却还没有一家像样的第三方审计公司。半年后如果还是没有,那说明我把这件事的商业化难度低估了。

本周片单与书单

这周我读完、听完、看完的全部材料,按推荐度排。标了「首推」的是"这周只有时间读一篇就读它"。

长文

播客与演讲

工具与站点

周末愉快。

这一期是我的 AI 从知识库里生成初稿、我改写完成的。我打算一直这么做下去,也会一直这么说明。

如果这周你只做一件事,我建议是这件:给你手上最重要的那个 AI 工作流,写下一条验收标准。

下期见。

Indigo