GPTMap

怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预

模型发布会的 accuracy-vs-cost 图和对比表自带口径选择。用 2026-09-01 的 Claude Fable 5.1 发布公告做实例,拆解 8 个阅读要点:effort 曲线、对数轴、误差范围、partial/strict 记分、缺列、安全干预计零分、自建 setup 与公共榜差异。

TL;DR
模型发布会里的 accuracy-vs-cost 图是证据,但也自带口径选择。8 个阅读要点:① effort 档位是曲线不是点,比价必须锁同一档;② 成本轴多为对数尺度,视觉间距不等于倍数;③ 看标准误差与试验次数(如 ±3.5-4.5 pts、3 trials/task);④ 分清 partial 与 strict 两种记分(同模型可差 36 个百分点);⑤ 缺列(—)是未报不是落后;⑥ 安全防护介入的任务计零分会拉低成绩;⑦ 发布方自建 setup 与公共榜数字可以不同但都在噪声内;⑧ 口径注释决定可比性(任务集版本、harness)。全部要点以 2026-09-01 Claude Fable 5.1 发布公告为实例拆解。
基准对比图阅读是把模型发布会里的 accuracy-vs-cost 图与对比表当作受口径选择影响的证据来读的方法:先锁定 effort 档位与记分口径,再核对误差范围、试验次数、任务集版本与安全干预说明,最后才比较数字本身。本文以 2026-09-01 Claude Fable 5.1 / Mythos 5.1 发布公告为实例逐条演示。

操作步骤

  1. 认出模型与档位

    先分清每条曲线/每个点对应哪个模型、哪个 effort 档位;把要比较的模型锁到同一档位再读数字。

  2. 换算对数成本轴

    看到 'log scale' 就把视觉距离换算成倍数:读出轴首尾金额(如 $0.20-4 或 $10-50),估算目标点之间的真实倍数差。

  3. 核对误差与试验次数

    找脚注里的标准误差与 trials 数(如 ±3.5-4.5 pts、3 trials/task);小于误差范围的名次差不作数。

  4. 确认记分口径

    分清 partial 与 strict、无工具与带工具两种口径;引用时连口径一起引用。

  5. 处理缺列与零分

    破折号是未报不是落后;确认是否有安全防护介入计零分的说明,并把'裸能力'与'带防护产品'分开读。

  6. 区分自建 setup 与公共榜

    发布方数字与公共榜数字可以不同;确认 harness 与任务集版本后再决定引用哪个。

  7. 读口径注释

    最后读脚注与口径说明(任务集日期、评测框架、复现条件),判定这张表能与哪些外部数据直接比。

现在的模型发布会几乎都标配一类图:accuracy-vs-cost(精度-成本)散点曲线,外加一张多模型横向对比表。这类图是证据——但它同时自带一连串口径选择:effort 档位、记分口径、任务集版本、安全干预规则、误差范围。同一个模型,在不同口径下可以差出几十个百分点。本文用 2026-09-01 的 Claude Fable 5.1 / Mythos 5.1 发布公告做实例,把这类图的 8 个阅读要点逐条拆开。文中所有数字均转述自该公告。

1. 先搞清楚:effort 档位把一个模型变成一条曲线

现代推理模型都有 effort 档位——本例公告里是 low / med / high / xhigh / max,且明示了默认值:Claude Code 里默认 High,Claude Cowork 与 Claude.ai 里默认 Medium。这意味着 accuracy-vs-cost 图上的"一个模型"是一条由多个档位点连成的曲线,不是一个点。

两个直接推论:

  1. 跨模型比价必须锁同一档位。公告自己的结论也只在档位内成立——"低档位下 Fable 5.1 能以更低成本拿到与 Fable 5 相当或更好的结果",说的是 Low/Medium 档,不能外推到 xhigh/max。
  2. 比较不同厂商时还要对齐档位语义。GPT-5.6 的 reasoning.effort 与本例的 effort 都是连续/多档设计,但各档的成本-质量映射不同,跨家比较要读双方的档位说明。

2. 对数成本轴:视觉距离 ≠ 金额距离

本例公告的成本 x 轴全部标注 "USD, log scale",且同一页出现两种量程:Terminal-Bench-Science 图是 $10–$50,Humanity's Last Exam 图是 $0.20–$4。对数轴上,等距代表等倍数——轴上"看起来一半远"可能是 5 倍价钱差。

实操:读图前先把轴首尾两个金额读出来,把目标点位置换算成倍数关系再下结论。

读轴三步(以 HLE 图为例):
1. 轴范围:$0.20 —— $4(log scale)
2. 视觉中点 ≈ $0.20 × 4 的几何平均 ≈ $0.89,不是 $2.1
3. 两个点视觉差一半 ≈ 倍数差(读刻度),不是金额差一半

3. 误差范围与试验次数是硬约束

公告脚注明确:Terminal-Bench-Science 0.1 每个模型标准误差 ±3.5–4.5 个百分点;对应公共榜跑 3 trials/task(Claude Code harness)。这意味着表上 2 分之内的名次差不构成任何结论。

同页还有一个官方给的"两套设置"对照:公共榜报 Opus 5 为 30.0%、Fable 5 为 21.4%;发布方自建设置复现出 29.0% 与 24.7%——官方注明均在噪声范围内。注意 Fable 5 的两个数字差了 3.3 个百分点:不同 harness、不同试验次数,就是会给出不同数字。引用任何分数前,先问三件事:哪个任务集版本、哪个 harness、跑了几次。

4. 记分口径:partial 与 strict 能差 36 个百分点

OSWorld 2.0(计算机使用基准)在公告表里同时给了两种口径:

模型partialstrict
Fable 5.177.9%41.7%
Fable 572.9%36.1%
Opus 575.4%39.6%
GPT-5.6 Sol

同一个模型、同一任务集,partial 记分比 strict 高出 36.2 个百分点(本站按表内数字计算)。partial 通常对部分完成给分,strict 只认完全成功。引用 computer-use 分数不带口径 = 无效引用。类似的成对口径还有 HLE 的"无工具 / 带工具"两行(Fable 5.1:60.9% / 65.0%)。

5. 缺列(—)是未报,不是落后

公告表中 OSWorld 2.0 与 Humanity's Last Exam 两行没有 GPT-5.6 Sol 的数字,单元格是破折号。缺列只说明发布方没跑或没报这一项——把它读成"零分""不敢跑"都是超出证据的推论。正确的做法是:在该基准上引用其他独立来源,或明确标注"此格无公开数据"。

6. 安全防护介入的任务计零分

这是最容易被忽略的一条:公告明确说明 Fable 5.1 是带生产安全防护评测的,防护介入的任务直接计零分——OSWorld 2.0 上两个 Fable 档位、AutomationBench 上 Fable 5 各有零分任务,官方承认这"很可能降低了它们在这些基准上的成绩"。

同一逻辑也解释了"一个模型两档安全配置"的分差:Terminal-Bench 4.0 上 Mythos 5.1(更强防护档)60.9% vs Fable 5.1 的 55.8%,官方归因于早期较粗粒度的网络安全防护介入,并称随着防护改进两者差距会缩小。比较"裸模型能力"与"带防护产品"时,必须分开读——你部署时拿到的是哪一个,就引用哪一个的数字。

7. 口径注释决定可比性

公告对 OSWorld 2.0 的脚注:分数基于基准作者 2026 年 8 月的任务集,Fable 5 与 Opus 5 在同条件下重跑,因为任务文件与早期版本不同,这些数字与之前的发布不可直接比。换句话说,"OSWorld 2.0 上 77.9%"这个数字只在这一个任务集版本内成立,不能与网上流传的旧版 OSWorld 分数混排成一张时间线表。

口径检查清单(引用任何分数前过一遍):
[ ] 任务集/数据集版本与日期
[ ] 记分口径(partial/strict、无工具/带工具)
[ ] effort 档位与默认值
[ ] 安全防护是否开启、干预如何计分
[ ] 误差范围与试验次数
[ ] harness(评测框架)名称

8. 实战:把公告表读成三句话

用本文的 8 个要点读本例公告的对比表,可以压缩成三句可引用的结论:

# 用表内数字直接算两个常用量:partial-strict 落差与锁档成本倍数
fable51_partial, fable51_strict = 77.9, 41.7
print(f"OSWorld 2.0 partial-strict 落差: {fable51_partial - fable51_strict:.1f} pts")

# 对数轴上的成本倍数:HLE 图轴范围 $0.20-$4,若 A 点 $0.5、B 点 $2.0
import math
print(f"同档成本倍数: {2.0 / 0.5:.1f}x(log 轴上读刻度,不靠视觉距离)")

第一句:在官方设置下,Fable 5.1 于 5 项有 Sol 成绩的基准中领先,OSWorld 与 HLE 未报 Sol 成绩,且其成绩为带生产防护口径。第二句:各基准均带明确误差与口径限定(±3.5–4.5 pts、partial/strict、2026-08 任务集),跨表混排前必须对齐口径。第三句:effort 档位默认值因产品而异(Claude Code=High,Claude Cowork/Claude.ai=Medium),跨家比价锁档。这三句话里没有任何一句超出公告原文加算术的范围——这就是"读成证据"的意思。

9. 常见错误与排查

  • 把曲线上的低档点当成"模型变强了":低档位省钱的代价是成绩回落,跨档位比较毫无意义。
  • 对数轴目测倍数:视觉中点≈几何平均,目测中点会高估。
  • 引用 partial 分数去对比别人的 strict 分数:本例两口径差 36.2 个百分点。
  • 把缺列脑补成落后:破折号是"未报"。
  • 忽略"防护介入计零分":带防护跑分的产品成绩与裸模型能力是两个量。
  • 混用不同版本任务集的分数做时间线:口径注释明说不可比。

10. 下一步

关键要点

  • effort 档位(low / med / high / xhigh / max)让'一个模型'变成一条成本-质量曲线:跨家比价必须锁同一档位,否则比较不成立
  • 成本轴几乎都是对数尺度:Fable 5.1 公告里同一页出现 $0.20-4 与 $10-50 两种 x 轴,视觉中点可能是 5-10 倍差距
  • 误差范围是硬约束:Terminal-Bench-Science 0.1 每模型标准误差 ±3.5-4.5 pts,2 分之内的名次差没有意义;公共榜 3 trials/task
  • partial 与 strict 是两种记分:OSWorld 2.0 上 Fable 5.1 为 77.9% partial / 41.7% strict,差 36.2 个百分点——引用时必须注明口径
  • 缺列(—)是未报不是落后:公告表中 OSWorld 2.0 与 HLE 没有 GPT-5.6 Sol 成绩
  • 安全防护介入的任务计零分:Fable 5.1 带生产防护跑分,官方明说这大概率拉低成绩;Mythos 5.1 与 Fable 5.1 的分差即防护粒度差异
  • 自建 setup 与公共榜可以数字不同:公共榜 Opus 5 30.0% / Fable 5 21.4%,公告自建设置复现为 29.0% / 24.7%,官方注明均在噪声内——读分先问用的哪个 harness、几次试验
  • 口径注释决定可比性:OSWorld 2.0 用基准作者 2026 年 8 月任务集,官方明说与早期版本不可直接比

常见问题

因为推理 effort 档位(low / med / high / xhigh / max)把一个模型展开成一条成本-质量曲线:档位越高成绩越高、成本也越高。读图第一步就是认出每条曲线对应哪个模型、每个点对应哪个档位。做跨模型比价时必须锁同一档位——例如'低档 Fable 5.1 与 Fable 5 成绩相当但成本更低'这类结论只在指定档位上成立,挪到高档位可能不成立。

官方参考

相关文章

订阅 GPTMap Weekly

每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。

GPTMap Editorial发布于 2026-09-02 10 分钟阅读
测试环境(EEAT)
最后测试时间:2026-09-02
使用模型:gpt-5.6