测量前沿实验室里的 AI 研发速度:Anthropic 的三项自报指标解读
Anthropic 9-17 发布三项内部测量:研发自动化指数(Claude 主导 26% 的 AI 研发、九成以上工作达协作级)、智能体监督(超十亿决策 0.002% 被拦)与安全算力份额(约 6% / 12%)——附完整方法论与官方自认局限。
前沿实验室的 AI 研发正在被 AI 自己接管多少?2026-09-17(Newsroom 索引日期;原文页面本身未标日期),Anthropic 发布《Measurements for understanding the pace of AI development inside frontier labs》(作者 Marina Favaro、Phillie Wright),第一次把自己内部 AI 研发的自动化程度、智能体监督水位与安全算力份额拆成三组可复述的数字。本篇逐项转述这三项指标、关键数值、方法论与官方自认的局限(2026-09-18 发布次日重抓原文逐项核对)。所有数字都是官方自报口径——本篇不做与 OpenAI 生态的对比推演。
1. 为什么测量研发速度:问题定义
文章的出发点:AI 正越来越多地自动化自身的研发,逼近"递归自我改进"(recursive self improvement,一个模型完整建造它的后继者)。作者希望在公众讨论如何为前沿 AI 设速时,缩小实验室与外界之间的信息差——把"我们内部自动化到什么程度、怎么监督、安全占多少资源"变成公开数字。
三项指标一句话版:研发自动化指数回答"AI 干了多少",智能体监督回答"怎么盯着它们",安全算力份额回答"投入多少算力做安全"。
| 指标 | 测什么 | 当前值(官方口径) |
|---|---|---|
| 研发自动化指数 | AI 在 Anthropic AI 研发中承担的份额(AL0-AL5) | Claude 主导 26%;协作级以上超 90%;完全自主为零 |
| 智能体监督 | 监测覆盖率、复核时延、拦截升级率 | 覆盖 100%;十亿级决策拦 0.002%;被拦一周内人工复核 |
| 安全算力份额 | 安全工作占用算力比例 | 约 6%(AI 研发算力)/ 约 12%(AI 驱动研发算力) |
2. 指标一:研发自动化指数(R&D Automation Index)
分级的骨架来自 Epoch AI 的自动化等级尺度:AL0(无 AI 参与)到 AL5(完全自主、无人在环)。两个关键档位:AL3 是"协作"(collaborates)——AI 承担大块工作、人类紧密指导;AL4 是"主导"(leads)——AI 从高层提示出发端到端完成大部分任务、人类做监督。
当前数值(截至 2026-08):Claude 主导 26% 的 AI 研发工作;协作级以上的工作占 90% 以上;没有任何被测子集完全自主。
方法论:2026 年 7 月的每周,按部门随机抽 20% 员工,把他们的工作拆解编目成约 15,000 项细粒度任务,组织成一棵 542 节点(378 叶)的任务树并冻结为基线;Claude 智能体收集证据,由独立的 Claude 评审定级,任务按人时加权。校验数据:评审与人类的完全一致率 59%,高于人类与人类之间的 35%;一档以内的一致率 97%。另外用 2026-01 的对照任务篮子做了稳定性检查,未见新任务类型上升。
3. 指标二:智能体监督
这项指标拆成三个子项:覆盖率(多少比例的智能体动作经过监测器)、复核时延(动作发生到人工复核的时间)、拦截升级率(多大比例的动作被拦截或标记)。
当前数值:在最常用的内部平台上,任一时刻约有 30,000 个智能体在做研发与工程工作;100% 的智能体动作在执行前经过在线监测;2026 年 8 月分析了超过 10 亿个智能体决策,其中 0.002% 被拦截(约每 47,000 个拦一个);被拦动作在一周内有人工复核。离线监测侧:每周标记约 100,000 份转录,其中约 50 份升级到人工复核——约合每千份转录标记 1-2 份。
支撑设计:每个智能体有持久身份(模型升级不换身份);开放共享消息通道让智能体互相审计。METR 已对离线监测平台做过独立红队。
4. 指标三:安全算力份额
2026-07-13 至 07-20 的一周快照:约 6% 的 AI 研发算力、约 12% 的 AI 驱动研发算力投向安全工作。测法:用既有监测工具加基于 Claude 的分类器,对当周近 10,000 次运行抽样约 14%(偏向计算密集的运行);无法访问的转录保守计入 AI 研发侧。
官方对这条数字的自我警告最多:两用工作一律计入能力侧;防护用分类器排除在安全侧之外——所以这是刻意保守的下限口径。
5. 官方自认的局限(读数前必看)
原文给出的局限清单,逐条照录其意:
- 标签是尽力而为(best-effort)且未经独立验证;
- 算力快照只覆盖一周;
- 算力份额衡量支出而非工作量——效率提升可以在安全工作不减的情况下缩小份额;
- "什么算安全"本身依赖判断,作者主张举证责任应在开发方;
- 安全算力口径刻意保守(见第 4 节)。
引用本文任何数字时建议带上"官方自报"与对应的口径注释——这与读任何模型发布基准表是同一个纪律。
6. 政策语境:RSP 与第三方评估
文章把这套指标定位为对负责任扩展政策(RSP)能力评估的补充——RSP 官方页面(现行版本 3.4,2026-07-08 生效)本就包含 AI R&D 自动化相关的能力阈值,模型越过阈值后需要论证错位风险。这套指标也与 Advanced AI Framework 拟议的透明度义务对齐。落地上,Anthropic 计划在内部嵌入来自多家组织的独立第三方评估者,给以与内部风险团队对等的访问权,负责验证安全实践、报告事件与监测指标。
7. 怎么读这类自报数字
三步保守读法。第一步,先记口径再记数字:"主导 26%"只在 AL4 定义(端到端完成、人类监督)下成立,脱离定义引用就是误导。第二步,把互锁的数字一起读:26% 要和"协作级以上 90%""完全自主为零"同框,拦截率 0.002% 要和"100% 覆盖、每周 10 万标记"同框。第三步,承认自报属性:任务树与评审都是内部构建的,官方给出的局限清单要随数字一起携带。更一般的基准阅读方法见怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预。
8. 下一步
- 同日公告读法:Anthropic 生命科学验证计划(LSVP)解读:Mythos、Opus、Sonnet 向生物学工作负载分级开放——同属 Anthropic 9-17 的透明度与安全机制动作。
- 怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预——把"先问口径再读数字"的纪律套到任何官方数字上。
关键要点
- 三项指标:研发自动化指数(Epoch AI AL0-AL5 尺度)/ 智能体监督(覆盖率、复核时延、拦截升级率三个子指标)/ 安全算力份额——全部为 Anthropic 自报,官方同时公开方法论与局限
- 自动化指数关键数字:Claude 主导(AL4,端到端完成任务、人类监督)26% 的 AI 研发;90% 以上工作达协作(AL3)级以上;没有任何被测子集完全自主(数值截至 2026-08)
- 监督关键数字:最常用内部平台上任一时刻约 30,000 个智能体;100% 动作执行前过在线监测;2026-08 分析超 10 亿决策、0.002% 被拦(约 1/47,000);离线监测每周标记约 100,000 份转录、约 50 份升级人工复核
- 安全算力:2026-07-13 至 07-20 一周快照,约 6% 的 AI 研发算力、约 12% 的 AI 驱动研发算力投向安全工作——官方注明这是刻意保守的口径(两用工作计入能力侧)
- 方法论:2026-07 每周按部门随机抽 20% 员工,编目约 15,000 项任务并冻结为 542 节点(378 叶)任务树;独立 Claude 评审定级与人类完全一致率 59%(人类-人类为 35%)、一档以内一致 97%;METR 已独立红队其离线监测平台
- 政策语境:与负责任扩展政策(RSP)的能力评估互补、与 Advanced AI Framework 拟议的透明度义务对齐;Anthropic 计划嵌入多家组织的独立第三方评估者并给以对等内部访问权
常见问题
官方参考
相关文章
Humanity's Last Exam 深度解读:2,500 道前沿考题的来路与读法
HLE 是目前被引用最多的前沿推理基准:2,500 道跨学科考题、Nature 发表、还有会换题的动态版 HLE-Rolling。拆解它的来路(众包、bug bounty、题目替换史)、双口径记分(无工具/带工具)与正确的引用姿势。
阅读全文怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预
模型发布会的 accuracy-vs-cost 图和对比表自带口径选择。用 2026-09-01 的 Claude Fable 5.1 发布公告做实例,拆解 8 个阅读要点:effort 曲线、对数轴、误差范围、partial/strict 记分、缺列、安全干预计零分、自建 setup 与公共榜差异。
阅读全文Deep Research 多模型实战:GPT-5.6 vs Claude 4.5 vs Gemini 2.5 + 第三方研究工具对比
Deep Research(深度研究)在 GPT-5.6 / Claude 4.5 / Gemini 2.5 三家模型下的表现对比 + 与 Elicit / Consensus / Perplexity 等第三方研究工具的差异化定位。选哪个 DR、什么时候用第三方工具,文末给决策表。
阅读全文订阅 GPTMap Weekly
每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。
提交后将在新标签页打开 Buttondown 完成订阅确认。