GPTMap

测量前沿实验室里的 AI 研发速度:Anthropic 的三项自报指标解读

Anthropic 9-17 发布三项内部测量:研发自动化指数(Claude 主导 26% 的 AI 研发、九成以上工作达协作级)、智能体监督(超十亿决策 0.002% 被拦)与安全算力份额(约 6% / 12%)——附完整方法论与官方自认局限。

TL;DR
Anthropic 于 2026-09-17(Newsroom 索引日期)发布《Measurements for understanding the pace of AI development inside frontier labs》,提出三项自报指标并附当前数值:① 研发自动化指数——按 Epoch AI 的 AL0-AL5 尺度,Claude 主导(AL4)26% 的 AI 研发、九成以上工作达协作(AL3)级以上、无任何子集完全自主(截至 2026-08);② 智能体监督——最常用内部平台上任一时刻约 3 万个智能体、100% 动作执行前过在线监测、2026-08 超 10 亿决策 0.002% 被拦;③ 安全算力份额——7 月中旬一周快照约 6%(AI 研发算力)/ 12%(AI 驱动研发算力)。方法论与官方自认局限一并公开。
前沿实验室研发速度测量是 Anthropic 提出的一套自我量化框架:用研发自动化指数(按 Epoch AI 的 AL0-AL5 尺度衡量 AI 在自家 AI 研发中承担的份额)、智能体监督指标(监测覆盖率、复核时延、拦截升级率)与安全算力份额(安全工作占用的算力比例)三项指标,把实验室内部 AI 研发的自动化速度与监督水位变成可对外公开的数字。

前沿实验室的 AI 研发正在被 AI 自己接管多少?2026-09-17(Newsroom 索引日期;原文页面本身未标日期),Anthropic 发布《Measurements for understanding the pace of AI development inside frontier labs》(作者 Marina Favaro、Phillie Wright),第一次把自己内部 AI 研发的自动化程度、智能体监督水位与安全算力份额拆成三组可复述的数字。本篇逐项转述这三项指标、关键数值、方法论与官方自认的局限(2026-09-18 发布次日重抓原文逐项核对)。所有数字都是官方自报口径——本篇不做与 OpenAI 生态的对比推演。

1. 为什么测量研发速度:问题定义

文章的出发点:AI 正越来越多地自动化自身的研发,逼近"递归自我改进"(recursive self improvement,一个模型完整建造它的后继者)。作者希望在公众讨论如何为前沿 AI 设速时,缩小实验室与外界之间的信息差——把"我们内部自动化到什么程度、怎么监督、安全占多少资源"变成公开数字。

三项指标一句话版:研发自动化指数回答"AI 干了多少",智能体监督回答"怎么盯着它们",安全算力份额回答"投入多少算力做安全"。

指标测什么当前值(官方口径)
研发自动化指数AI 在 Anthropic AI 研发中承担的份额(AL0-AL5)Claude 主导 26%;协作级以上超 90%;完全自主为零
智能体监督监测覆盖率、复核时延、拦截升级率覆盖 100%;十亿级决策拦 0.002%;被拦一周内人工复核
安全算力份额安全工作占用算力比例约 6%(AI 研发算力)/ 约 12%(AI 驱动研发算力)

2. 指标一:研发自动化指数(R&D Automation Index)

分级的骨架来自 Epoch AI 的自动化等级尺度:AL0(无 AI 参与)到 AL5(完全自主、无人在环)。两个关键档位:AL3 是"协作"(collaborates)——AI 承担大块工作、人类紧密指导;AL4 是"主导"(leads)——AI 从高层提示出发端到端完成大部分任务、人类做监督。

当前数值(截至 2026-08):Claude 主导 26% 的 AI 研发工作;协作级以上的工作占 90% 以上;没有任何被测子集完全自主。

方法论:2026 年 7 月的每周,按部门随机抽 20% 员工,把他们的工作拆解编目成约 15,000 项细粒度任务,组织成一棵 542 节点(378 叶)的任务树并冻结为基线;Claude 智能体收集证据,由独立的 Claude 评审定级,任务按人时加权。校验数据:评审与人类的完全一致率 59%,高于人类与人类之间的 35%;一档以内的一致率 97%。另外用 2026-01 的对照任务篮子做了稳定性检查,未见新任务类型上升。

3. 指标二:智能体监督

这项指标拆成三个子项:覆盖率(多少比例的智能体动作经过监测器)、复核时延(动作发生到人工复核的时间)、拦截升级率(多大比例的动作被拦截或标记)。

当前数值:在最常用的内部平台上,任一时刻约有 30,000 个智能体在做研发与工程工作;100% 的智能体动作在执行前经过在线监测;2026 年 8 月分析了超过 10 亿个智能体决策,其中 0.002% 被拦截(约每 47,000 个拦一个);被拦动作在一周内有人工复核。离线监测侧:每周标记约 100,000 份转录,其中约 50 份升级到人工复核——约合每千份转录标记 1-2 份。

支撑设计:每个智能体有持久身份(模型升级不换身份);开放共享消息通道让智能体互相审计。METR 已对离线监测平台做过独立红队。

4. 指标三:安全算力份额

2026-07-13 至 07-20 的一周快照:约 6% 的 AI 研发算力、约 12% 的 AI 驱动研发算力投向安全工作。测法:用既有监测工具加基于 Claude 的分类器,对当周近 10,000 次运行抽样约 14%(偏向计算密集的运行);无法访问的转录保守计入 AI 研发侧。

官方对这条数字的自我警告最多:两用工作一律计入能力侧;防护用分类器排除在安全侧之外——所以这是刻意保守的下限口径。

5. 官方自认的局限(读数前必看)

原文给出的局限清单,逐条照录其意:

  • 标签是尽力而为(best-effort)且未经独立验证;
  • 算力快照只覆盖一周;
  • 算力份额衡量支出而非工作量——效率提升可以在安全工作不减的情况下缩小份额;
  • "什么算安全"本身依赖判断,作者主张举证责任应在开发方;
  • 安全算力口径刻意保守(见第 4 节)。

引用本文任何数字时建议带上"官方自报"与对应的口径注释——这与读任何模型发布基准表是同一个纪律。

6. 政策语境:RSP 与第三方评估

文章把这套指标定位为对负责任扩展政策(RSP)能力评估的补充——RSP 官方页面(现行版本 3.4,2026-07-08 生效)本就包含 AI R&D 自动化相关的能力阈值,模型越过阈值后需要论证错位风险。这套指标也与 Advanced AI Framework 拟议的透明度义务对齐。落地上,Anthropic 计划在内部嵌入来自多家组织的独立第三方评估者,给以与内部风险团队对等的访问权,负责验证安全实践、报告事件与监测指标。

7. 怎么读这类自报数字

三步保守读法。第一步,先记口径再记数字:"主导 26%"只在 AL4 定义(端到端完成、人类监督)下成立,脱离定义引用就是误导。第二步,把互锁的数字一起读:26% 要和"协作级以上 90%""完全自主为零"同框,拦截率 0.002% 要和"100% 覆盖、每周 10 万标记"同框。第三步,承认自报属性:任务树与评审都是内部构建的,官方给出的局限清单要随数字一起携带。更一般的基准阅读方法见怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预。

8. 下一步

关键要点

  • 三项指标:研发自动化指数(Epoch AI AL0-AL5 尺度)/ 智能体监督(覆盖率、复核时延、拦截升级率三个子指标)/ 安全算力份额——全部为 Anthropic 自报,官方同时公开方法论与局限
  • 自动化指数关键数字:Claude 主导(AL4,端到端完成任务、人类监督)26% 的 AI 研发;90% 以上工作达协作(AL3)级以上;没有任何被测子集完全自主(数值截至 2026-08)
  • 监督关键数字:最常用内部平台上任一时刻约 30,000 个智能体;100% 动作执行前过在线监测;2026-08 分析超 10 亿决策、0.002% 被拦(约 1/47,000);离线监测每周标记约 100,000 份转录、约 50 份升级人工复核
  • 安全算力:2026-07-13 至 07-20 一周快照,约 6% 的 AI 研发算力、约 12% 的 AI 驱动研发算力投向安全工作——官方注明这是刻意保守的口径(两用工作计入能力侧)
  • 方法论:2026-07 每周按部门随机抽 20% 员工,编目约 15,000 项任务并冻结为 542 节点(378 叶)任务树;独立 Claude 评审定级与人类完全一致率 59%(人类-人类为 35%)、一档以内一致 97%;METR 已独立红队其离线监测平台
  • 政策语境:与负责任扩展政策(RSP)的能力评估互补、与 Advanced AI Framework 拟议的透明度义务对齐;Anthropic 计划嵌入多家组织的独立第三方评估者并给以对等内部访问权

常见问题

两者都出自 Anthropic 沿用的 Epoch AI 自动化分级(AL0 无 AI 参与到 AL5 完全自主)。AL3 是协作(collaborates):AI 承担大块工作、但在人类紧密指导下进行;AL4 是主导(leads):AI 从高层提示出发端到端完成大部分任务、人类做监督。一个直观差别:AL3 里人类在环内逐步推进,AL4 里人类只在环外监督结果。

官方参考

相关文章

订阅 GPTMap Weekly

每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。

提交后将在新标签页打开 Buttondown 完成订阅确认。

GPTMap Editorial发布于 2026-09-18 9 分钟阅读
测试环境(EEAT)
最后测试时间:2026-09-18
使用模型:gpt-5.6