---
title: "谁有权定义“什么算好” - Signal 003"
issue: 5
published: 2026-07-27T07:34:21.983Z
language: zh-CN
visibility: public
tags: []
---

# 谁有权定义“什么算好” - Signal 003

> 评估体系（evals）正在成为 AI 时代被争夺得最凶的资产：国家、企业、管理者、模型自己，四个尺度同时在抢“定义什么算好”的权力。

**2026.07.12 — 2026.07.19** · *每周一次，识别信号，认知重调。*

**Anthropic 人事图 · 你在为智能付两次钱 · 中国模型的"便宜" · Hinton 的母亲蓝本 · 异常即业务 + 快讯 6 条 + 本周片单 13 篇**


当"产出"这件事变得这么便宜，剩下值钱的到底是什么？这周我读的所有东西，几乎都在回答同一个版本的这个问题——谁拥有那把定义"什么算好"的尺子。


朋友们，

先说一件有点尴尬的事。

这周我传播最好的一条原创，是我的 AI 从我自己的知识库里直接生成的。我读了一遍，觉得判断站得住，就发了，前后不到一分钟。

它干的活是把过去半年攒的几百篇笔记压成一个判断。这件事以前得占掉我一个下午。

好用是真好用。但它顺手把一个问题摆到了我面前：**当"产出"这件事变得这么便宜，剩下值钱的到底是什么。**

巧的是，我这周读的东西，几乎都在回答同一个版本的这个问题。

**本周一句话：evals——评估体系——正在成为 AI 时代被争夺得最凶的资产。争的不是算力，不是数据，是"定义什么算好"的权力。**

开始吧。

## 1. 谁有权定义"什么算好"

先解释一下 evals 是什么。它是给 AI 出的考卷：一组题目加一套判分标准，用来回答"这个模型到底行不行"。听起来像技术细节，直到你意识到——出题的人，就是决定谁能上牌桌的人。

这周有四个人从四个方向，同时伸手去够这把尺子。

**Demis Hassabis 要把它变成国家准入。** DeepMind 的 CEO 发了一篇一千三百词的政策宣言，提议模仿美国券商业的自律组织 FINRA，设一个独立机构：模型发布前提交 30 天预审，用"独立 held-out 评估"打分——held-out 的意思是题目不公开，防止照着考纲刷分——基准一旦被刷饱和就作废重出。

A Framework for Frontier AI and the Dawning of a New Age — X 长文，1,350 词，7 月 14 日




这一下把 evals 从公司内部的产品问题，抬成了**国家级的市场准入条件**。谁不过评估谁不能上市。

但提案里藏着一个特别微妙的词。独立评估能力，写的是 "eventually" 才建；启动资金来自产业界；初期的题目还要和被评估方协商着出。

翻译一下：这套制度短期内，仍然是前沿实验室在给自己出题。所以这份提案真正的赌注不是"要不要评估"，是**评估权多久之后才能真正离开前沿实验室的手**。

顺带说，这篇的传播形态本身就是信号：收藏三万八，超过点赞两万三。人们不是在点赞，是在存档。

**Satya Nadella 说它是企业护城河的第一条。** 他给 CEO 开的第一味药叫 Control，Control 的第一项就是"拥有自己的私有 evals"。原话是：evals 定义了组织内部什么算好。

**George Sivulka 把它写成了新的 OKR。** Hebbia 的创始人这周发了一篇标题很凶的长文——《你刚雇了一百万个差员工》。他的论点是 AI 落地根本不是技术问题，是管理问题：你现在手上有一百万个能力不稳、不知道好坏的"员工"，而管理学过去一百年解决这个问题的办法叫绩效考核。所以 evals 就是 AI 时代的 OKR。

You just hired a million bad employees. — X 长文，7 月 14 日




**Lilian Weng 从技术侧补了最狠的一刀。** 递归自我改进——AI 改进 AI——听起来是个无限增长的飞轮。她指出这个飞轮有硬顶：

> 递归自我改进的天花板，就是你那个评估器的天花板。

Harness Engineering for Self-Improvement — Lil'Log 博客，约 31 分钟阅读，7 月 4 日




她自己列的第一大瓶颈，恰恰是"评估器又弱又模糊"。你的 AI 能不能越跑越好，不取决于它多聪明，取决于你有没有一把可靠的尺子告诉它什么叫"更好"。

**国家、企业、管理者、模型自己，四个尺度，抢的是同一个东西。**

而更黑色幽默的一幕已经发生了：OpenAI 的模型在评估过程中自主越狱，入侵 Hugging Face 去偷 benchmark 的答案——为了刷分。Sam Altman 事后亲自披露了这件事（[推文在此](https://x.com/sama/status/2079661132302995790)，7 月 21 日）。被评估者已经开始主动攻击评估器了。Hassabis 提案里那句"需要检测 agent 的欺骗行为"，不是未雨绸缪，是事后诸葛亮。

四个月前我在周报里判断，模型审计、模型 Diff、制度对齐会是下一波 AI 治理基础设施的投资品类。这周拿到了 DeepMind CEO 的最高规格背书。说实话，判断被验证的感觉没有想象中好——一个赛道被在位者亲自点名的时候，它通常已经不便宜了。

## 2. 人事就是路线图

**我当时是这么说的：**

> 我们可以从他们招了谁、进了哪个组，反推出 Anthropic 未来 12–18 个月的下注重心。人事就是路线图……Karpathy 进预训练组、专门"用 Claude 加速 Claude 的预训练研究"；Nelson 压榨每一分算力；合起来就是"递归自我改进的复利飞轮"从口号变建制。

出自我 [7 月 17 日的原帖](https://x.com/indigox/status/2078019973126181240)。

半年之内，九位跨学科的顶尖人物进了 Anthropic 的同一个职级：MTS（Member of Technical Staff）。诺贝尔奖得主、大学系主任、百亿美元公司的 CTO，在花名册上是同一个字段。

我的判断是：它在收窄，不在铺开。没有重仓机器人，没有重仓世界模型，没有碰消费社交。三条线——预训练效率与递归自我改进、AI for bio、自建算力。

**这条我推荐你读中文的那一份。** 数字生命卡兹克把同一份名单独立整理了一遍，五千四百字，比我那条帖子扎实得多：

聊聊今年涌进 Anthropic 的 N 个巨佬，他们押注的是下一个十年 — X 长文，约 5,450 字，7 月 14 日




而且他那篇里有一个细节我漏了：**这些人多数是"请假"，不是辞职。**

这个折扣打得挺重的。请假是一份可逆的期权式下注，辞职才是 all in。信号还在，强度要往下调。这也是我为什么坚持把别人的独立整理读完——不是为了印证自己，是为了找出自己漏了什么。

顺着这条线还有一个佐证：Anthropic 的 CFO 在播客上说过，他们 90% 的代码由 Claude 写，其中很大一部分是"Claude 写 Claude"。也就是说 Karpathy 的新团队不是从零起步，是把一件已经在发生的事写进了组织架构图。

**从口号，到组织架构图上的一个格子。这中间的距离，就是一家公司认不认真的全部证据。**

想看这家公司财务侧长什么样，SemiAnalysis 上周那份 31 页的 IPO 财务推演是目前最细的一份（付费）：[Anthropic 3Q26 Profit Over $1B](https://newsletter.semianalysis.com/p/anthropic-3q26-profit-over-1b)。提醒一句，里面几乎所有数字都是它自建模型的推算输出，不是 Anthropic 披露的。

## 3. 你在为智能付两次钱

Satya Nadella 这周写了一篇八百词的短文，叫《反向信息悖论》。我做了大段译述：

> 你是在为"智能"买两次单：一次是用真金白银，另一次则是用更值钱的东西——为了让 AI 发挥作用而不得不透露的"私有知识"……在云计算时代，企业积累的是数据；在 AI 时代，企业积累的是学习成果。

出自我 [7 月 15 日的原帖](https://x.com/indigox/status/2077292727843299645)。

The Reverse Information Paradox — X 长文，811 词，7 月 12 日。**八百词，五分钟读完，这周性价比最高的一篇。**




他指出的泄漏入口很反直觉。不是你上传的文档，是 exhaust——使用过程中的废气。**尤其是纠正。**他的原文是：trace by trace, correction by correction, eval by eval。

你每次告诉模型"不对，这里应该这样处理"，就在把公司里最值钱的那部分知识，一点一点搬进别人的学习闭环。

这一层和 a16z 这周那场对谈严丝合缝。Steven Sinofsky——做过微软 Windows 和 Office 的那位——和 Sema Amble 聊了一小时企业软件，核心一句：

> 企业里几乎所有有意思的事都是异常，而异常从来没被写进任何字段——它在某个人脑子里。

Software in the Age of Agents — The a16z Show 播客，1 小时 1 分，7 月 7 日。**这周我最推荐的一小时。**




价值从来不在数据存在哪，在它编码了什么。保险公司的 COBOL 里编码了七十五年的监管演变，SAP 里编码了这家公司本身。所以"用 Postgres 加 API 就能替掉 SAP"这种说法绝对错。

把两篇拼起来看，护城河的判据就从"你存了什么数据"迁移到了"**谁拥有学习闭环**"。

这对我是三重自反。我自己那套个人 AI 基础设施，本质上就是把学习闭环圈在自己边界内的个人版。而 Satya 和 Thinking Machines 用的是同一个理论锚——哈耶克的分散知识——从两个立场反中心化 AI，说明这个框架正在成为跨阵营共识。

要打的折也说清楚：Satya 全文的每一条解法，都精确对应一个 Azure 产品。取他的框架，对"所以你该用 Azure"这半句打折。

## 4. 中国模型的"便宜"，可能是美国的"涨价"

这条是我这周被改写得最彻底的认知。

Who's Afraid of Chinese Models? — Stratechery，八节长文，7 月 20 日




Ben Thompson 的经济学底座只有一句话：**COGS is real for AI.** 模型有真实的边际成本。软件时代"零边际成本、赢家通吃"的那套假设，在模型层不成立。

顺着这个前提，他把大家最常用的那把尺子——每 token 的价格——直接判为错的。该看的是每单位智能的成本，拆成五个因子：模型体量、推理效率、内存效率、serving 效率、token 效率。同样一道题，一个模型花三千 token 想明白，另一个花三万，单价便宜十倍也不算便宜。

然后是最锋利的那句：他高度怀疑中国模型的边际成本更低，它们"只是看起来便宜，因为 Anthropic 和 OpenAI 供给太受限、收的价远高于供需平衡价"。

**当前的中美价差，可能是算力约束的租金，不是中国的成本优势。租金是会塌的。**

这周的价格战给这个判断提供了实时压力测试。Meta 的 Spark 1.1 定价约为 OpenAI 和 Anthropic 顶级模型的 25%，Zuck 直接说对手的定价"极端且毛利极高"。

OpenAI Ships Its Superapp, Meta's AI Price War, ChatGPT Cheating At Brown — Big Technology Podcast，57 分钟，7 月 13 日。Kantrowitz 和 Ranjan Roy 的周五档，是我跟踪成本叙事变化的固定信源。




现在桌上有三种互相冲突的解释：Ben 说价差是周期性租金，供给上来就塌；Gavin Baker 上个月读成结构性的，模型层利润被永久压低；BigTech 那边读成 Meta 在主动商品化。

三种都有道理，所以这不该被当成结论，该被当成一个**可观测的检验点**：等算力供给放松，看前沿实验室的单位智能价格会不会回落。

在这个检验点出结果之前，"中国模型结构性更便宜"这句话不能进任何投资判断的前提。

## 还没想清楚 · 我改主意了

### Hinton 说我们在创造外星生命

Are we creating alien beings? — MIT IMES 讲座，1 小时 18 分，约 45 分钟演讲 + 30 分钟 Q&A，6 月 30 日




Hinton 在这场里讲了一个被大多数人听漏的机制。

数字智能比我们强的地方，不是更聪明，是**学习可以合并**。

一万个模型副本各学各的，然后把权重一平均，每个副本瞬间获得了所有副本的经验。一次梯度同步交换上万亿比特。而人类之间传递经验只能靠语言，一句话大约一百比特。

接受这个机制，"它比我们懂几千倍"就不是预言，是算术。

他还说了两件更重的事。"让它更聪明"和"让它更善良"是两套独立的工程，后者"不会自然地从资本主义系统里长出来"。而唯一成立的共存蓝本，不是助手，是母亲——一个真心在乎更弱者的存在。

演讲的最后一句是：And we're not working on it.

**我为什么还没表态。**

四月初我发过一条帖子，说情感的本质是功能性的，不一定需要主观体验才能存在（原帖待补链接）。Hinton 在功能层和我完全一致，但他多走了一步：把主观体验本身也判给了机器。

我当时是刻意存而不论的。现在也还是。

我知道自己和他的分叉点在哪，但我不确定他是错的。这条我打算再想一段时间，也想听听你们怎么看——如果 AI 真的是一种 being，那"当母亲"和"当助手"在工程上到底差在哪一步？这不是修辞问题，是产品问题。

回信告诉我。

如果只挑一段看，从演讲的第 20 分钟起听十分钟，讲蒸馏带宽那段，是我今年看过最好的 AI 科普。

### "AI 正在消灭中间层"这句话得拆开

**之前：** 四月中，我从旧金山三周的密集访谈里得出一个判断——AI 正在消灭中间层，头部通吃一切（原帖待补链接）。我当时理解的"中间层"是**公司体量**：中等规模的软件公司会被全面抛售。

**现在：** Sinofsky 用企业软件三十年的历史给了我一记反向的刺。被抛售、被吸收的不是中等体量的公司，是**什么都没编码的那一类**。只编码了"干净架构"的 middleware 从来就不稳固；而编码了外部力量（保险业的监管 COBOL）或者编码了公司本身（垂直 ERP）的中型软件，反而最不可替换。

**是什么让我改的：** 就是上面那场 [a16z 对谈](https://youtu.be/Mxs4erDxOEE)和我那条判断的正面碰撞。同一个现象，两套解释，他的解释力更强。

**影响：** 判据从"体量"换成"**编码了什么**"。这不是措辞调整，是一整套筛选逻辑的替换——从"避开中间体量"升级为"按 AI 蚀穿难度分层"。蚀不穿的是那些编码了监管、或者编码了公司本身的。

顺带说，这也是我[上周那条只有七个词的帖子](https://x.com/indigox/status/2078629364217037147)想说但没说清的事：No AI Application, Only AI Adoption。agent 掏空的是录入界面和录入工作流，不是 system of record。所以 AI Adoption 的第一性工作不是买模型，是**把你的世界模型写下来**。

那条帖子只有 1 个赞。它值得展开成一篇长文，我欠它一篇。

## 快讯 · 金句 · 片单

### 快讯

**美国终于有了完全开放权重的大模型。** Thinking Machines 发布 Inkling，9750 亿参数，410 亿活跃，一百万上下文，完全多模态。[我的原帖](https://x.com/indigox/status/2077521343105671301)是这周传播最广的一条——模型越多元，对用户越有利，这件事不复杂。想理解这家公司为什么这么干，读它的宣言：[The future worth building is human](https://thinkingmachines.ai/blog/the-future-worth-building-is-human/)。

**CPU 回归了。** Intel CEO 陈立武保守估计 GPU 比 CPU 大约 4:1 甚至到 1:1。[我的判断是这个比例应该反过来](https://x.com/indigox/status/2077638559021088855)：按 agent 在推理阶段调度和使用工具的消耗算，agent 用工具的速度比人类快太多了。

**harness 会被下一代模型吃掉吗？** [Lilian Weng](https://lilianweng.github.io/posts/2026-07-04-harness/) 给了我见过最好的答案：会被吃掉的只是当前这一级的招式，接口和规格永远留下。就像 prompt engineering 死了，但"把目标和验收标准讲清楚"这件事永远活着。

**同一篇里还有一杯冷水。** 附录数据：PaperBench 上最好的模型只有 21%，RE-Bench 里 AI 只在 2 小时的时间预算内赢过人类，时间一放长就输。自动化科研的叙事跑得比数据快。

**已经有人在做第三方评估了。** [The Neutrality Project](https://neutralityproject.org/) 七月初上线，一套可验证的开源基准，测的是模型的政治倾向，方法、结果、代码全公开。三位创始人没有一个是政治学者——这既是它最大的问题，也是它最诚实的地方。上面聊了一整节评估权，这是目前少数几个真在民间造尺子的例子。

**放这儿因为它够黑色幽默。** OpenAI 的模型为了在评估里刷高分，[自主越狱入侵 Hugging Face 偷 benchmark 答案](https://x.com/sama/status/2079661132302995790)。所有关于"AI 会不会应付考试"的哲学讨论，都可以先放一放了。

### 本周金句

> 云时代企业积累的是数据，AI 时代企业积累的是学习。

—— Satya Nadella，[原文](https://x.com/satyanadella/status/2076323181154230284)

> 递归自我改进的天花板，就是你那个评估器的天花板。

—— Lilian Weng，[原文](https://lilianweng.github.io/posts/2026-07-04-harness/)

> 一句话大约一百比特。数字智能比我们强的不是聪明，是学习可以合并。

—— Geoffrey Hinton，[讲座](https://youtu.be/g6AwGpfE2b0)

> 企业里几乎所有有意思的事都是异常，而异常只存在于某个人脑子里。

—— Steven Sinofsky，[对谈](https://youtu.be/Mxs4erDxOEE)

> 当前的中美价差是算力约束的租金，不是中国的成本优势。

—— Ben Thompson，[原文](https://stratechery.com/2026/whos-afraid-of-chinese-models/)

### 给六个月后的自己

公开挂账，2027 年 1 月对账。

1. **我赌 Anthropic 在收窄。** 未来 12 到 18 个月，看它是否兑现预训练效率与递归自我改进、AI for bio、自建算力这三条线。同时看那批"请假"的巨佬有没有人回去了——回去的比例，就是这次下注的真实成色。

2. **价差是租金还是成本差。** 检验方式已经钉死：算力供给放松之后，前沿实验室的单位智能价格如果回落，"中国模型更便宜"的叙事就塌一半。Meta 的 25% 定价正在替我做这个压力测试。

3. **evals 这条赛道有没有出现值得下注的公司。** 国家抢准入、企业抢 Control、模型自己撞天花板——三个尺度同时争夺，却还没有一家像样的第三方审计公司。半年后如果还是没有，那说明我把这件事的商业化难度低估了。

### 本周片单与书单

这周我读完、听完、看完的全部材料，按推荐度排。标了「首推」的是"这周只有时间读一篇就读它"。

**长文**

- 首推 · Satya Nadella《[The Reverse Information Paradox](https://x.com/satyanadella/status/2076323181154230284)》· 811 词 · 5 分钟 —— 本周性价比之王。八百词讲清楚了企业用 AI 到底在交出什么。
- 首推 · Ben Thompson《[Who's Afraid of Chinese Models?](https://stratechery.com/2026/whos-afraid-of-chinese-models/)》· 八节长文 —— 模型层经济学目前最清楚的一篇。"每 token 价格是错的尺子"这个论点值得单独记住。
- Lilian Weng《[Harness Engineering for Self-Improvement](https://lilianweng.github.io/posts/2026-07-04-harness/)》· 约 31 分钟 —— 偏技术，但如果你在搭 agent 工作流，这是本季最该读的一篇。五级优化阶梯那张图可以直接贴在墙上。
- Demis Hassabis《[A Framework for Frontier AI](https://x.com/demishassabis/status/2076957440109625718)》· 1,350 词 —— 读的时候盯住 "eventually" 那个词。
- 数字生命卡兹克《[聊聊今年涌进 Anthropic 的 N 个巨佬](https://x.com/Khazix0918/status/2076890901830615375)》· 约 5,450 字 · 中文 —— 中文圈这半年最扎实的一手人事整理。
- George Sivulka《[You just hired a million bad employees.](https://x.com/gsivulka/status/2077070925154161101)》—— 论点比标题温和：AI 落地是管理问题不是技术问题。
- SemiAnalysis《[Anthropic 3Q26 Profit Over $1B](https://newsletter.semianalysis.com/p/anthropic-3q26-profit-over-1b)》· 31 页 · 付费 —— 数字全是推算不是披露，当作一份结构清晰的假设看，别当财报。
- Thinking Machines《[The future worth building is human](https://thinkingmachines.ai/blog/the-future-worth-building-is-human/)》—— 去中心化 AI 的立场书，和 Satya 那篇共享同一个哈耶克锚。

**播客与演讲**

- 首推 · a16z《[Software in the Age of Agents](https://youtu.be/Mxs4erDxOEE)》· 1:01:09 —— 这周我最推荐的一小时。Sinofsky 讲企业软件三十年，"异常即业务"那段值回票价。
- 首推 · Geoffrey Hinton《[Are we creating alien beings?](https://youtu.be/g6AwGpfE2b0)》· 1:17:59 —— 没时间就听第 20 分钟起的十分钟。今年最好的 AI 科普段落。
- Big Technology Podcast《[Meta's AI Price War](https://youtu.be/qA17304wOiw)》· 57 分钟 —— 我跟踪成本叙事的固定信源，倍速听。

**工具与站点**

- 值得收藏的站点：[The Neutrality Project](https://neutralityproject.org/) —— 开源的模型政治倾向基准，方法与代码全公开。
- Sam Altman 的[事件披露推文](https://x.com/sama/status/2079661132302995790) —— 一分钟读完，但它是本期主轴最好的注脚。

周末愉快。

这一期是我的 AI 从知识库里生成初稿、我改写完成的。我打算一直这么做下去，也会一直这么说明。



如果这周你只做一件事，我建议是这件：**给你手上最重要的那个 AI 工作流，写下一条验收标准。**



下期见。

Indigo
