Humanity's Last Exam 深度解读:2,500 道前沿考题的来路与读法
HLE 是目前被引用最多的前沿推理基准:2,500 道跨学科考题、Nature 发表、还有会换题的动态版 HLE-Rolling。拆解它的来路(众包、bug bounty、题目替换史)、双口径记分(无工具/带工具)与正确的引用姿势。
操作步骤
确认口径
引用任何 HLE 分数前先确认是无工具还是带工具、静态版还是 Rolling 版——四项任一不同即不可比。
核对缺列
对比表中某模型的破折号是'未报'不是'落后';需要该模型数据时找其官方发布口径,找不到就留空并注明。
换算与误差
同一模型的双口径差可达数个百分点;跨模型比较优先看同一口径内的差距,并结合发布方给出的误差说明。
用真实任务校验
把 HLE 定位为推理难度参照,最终选型用领域数据或自建任务集验证——基准分数只是初筛,不是结论。
如果你读模型发布会,几乎绕不开一个名字:Humanity's Last Exam(HLE)。它被主要厂商的公告表列为推理能力对比项,也是"前沿难度"的代名词之一。但大多数引用只给一个百分数——题目从哪来、2,500 题怎么防污染、无工具与带工具两行分数差在哪、动态版意味着什么,很少有人讲。本文基于 HLE 官方站点(2026-09-08 重抓核对)与最新模型发布实例,拆解 HLE 的来路与正确的引用姿势。
1. HLE 是什么:一页简历
HLE 由 Scale AI 与 Center for AI Safety(CAIS)出品,定位是跨学科前沿推理基准——题目由 500+ 机构、50 国的贡献者(以教授、研究人员与研究生学位持有者为主)提交,覆盖上百个学科。三个硬事实:2025-04-03 定稿 2,500 道题;2026-01-28 发表于 Nature(Nature 649, 1139–1146);数据集以 cais/hle 托管,配套 Arxiv 论文、GitHub 仓库与实时提交看板。
2. 题目怎么来的:一套"防检索污染"的设计
HLE 的立身之本不是题难,而是题干净。它的题目来自全球贡献者提交,随后经过一轮完整的质量流程:
- 开放补充征集:先向社区广泛收集候选题;
- Bug bounty 纠错:社区反馈扩展阶段设立赏金计划,专门标记有缺陷的问题;
- 移除可搜索题:被标记的问题、以及"网上能搜到答案"的问题被移除并用其他题目替换;
- 定稿:2025-04-03 以 2,500 题定稿。
这套流程回答了一个根本问题:考模型推理,就不能让它能靠搜索作弊。静态题库无论多难,随时间推移都会被逐步"消化"——这正是第 3 节动态版出现的原因。
3. 动态版 HLE-Rolling:给题库"保鲜"
2025-10-08,官方上线动态版本 HLE-Rolling,并配实时提交看板。Rolling 版的题目持续更新,模型"提前背题"的空间被压缩。对使用者的含义:引用 HLE 成绩必须注明是静态版还是 Rolling 版——两者的题目集合不同,分数不可互相比较。它也代表基准评测的一个趋势:重要基准正在从"一次性定稿"走向"持续保鲜"。
4. 成绩怎么读:口径、缺列与对比表
模型发布会引用 HLE 时最常见的三个坑,都能在实例里看到。以 2026-09-01 的 Claude Fable 5.1 公告表为例:
| 模型 | 无工具 | 带工具 |
|---|---|---|
| Fable 5.1 | 60.9% | 65.0% |
| Fable 5 | 57.8% | 63.8% |
| Opus 5 | 56.6% | 63.6% |
| GPT-5.6 Sol | — | — |
三个读法要点:
- 双口径:无工具与带工具是两行独立成绩,同模型相差 4.1 个百分点(Fable 5.1)——引用必须带口径;
- 缺列是未报:GPT-5.6 Sol 在 HLE 行是破折号——未报不等于落后,需要时找该模型自己的官方口径;
# 同模型双口径落差(数字取自 2026-09-01 公告表)
fable51_no_tools, fable51_with_tools = 60.9, 65.0
print(f"Fable 5.1 无工具/带工具落差: {fable51_with_tools - fable51_no_tools:.1f} pts")
- 对比维度单一:HLE 只测跨学科推理,它不回答编码、长上下文、智能体能力——完整判断需要读整张对比表而非单行。
# HLE 引用自查清单
[ ] 口径:无工具 / 带工具
[ ] 版本:静态版 / HLE-Rolling
[ ] 日期:成绩的 as-of 信息
[ ] 试验次数与判分脚本版本
这套读法的完整版(对数成本轴、误差范围、安全干预计零分等)见《怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预》。
5. HLE 在深度研究工作流里的位置
对做深度研究的团队,HLE 有两个务实用途:
- 模型推理档位的参照系:在"前沿难度"这个维度上,HLE 提供了一个跨厂商可比的锚点——用它初筛哪些模型值得进入你的候选池;
- 评测方法论的参照:它的题目治理流程(bounty 纠错、替换可搜索题、动态保鲜)本身就是自建评测集时可以借鉴的设计模板。
但要守住边界:HLE 测的是推理,不是你的任务。领域数据、真实样例、成本与延迟,这些选型的最终依据任何基准都替代不了(质量控制总纲见《DeepResearch 输出质量控制:模型选型 + Prompt 调优 + 引用验证》)。
6. 常见错误与排查
- 把无工具与带工具分数混排:4 个百分点的口径差,足够颠倒名次。
- 静态版与 Rolling 版混比:题目集不同,分数语义不同。
# 引用格式示例(三要素齐全)
Fable 5.1 于 HLE(静态版、带工具)得 65.0%(2026-09-01 公告口径)
- 把缺列读成落后:破折号 = 未报,不是零分。
- 只看一个基准下结论:单基准名次是单维度名次;完整判断需要一组基准 + 真实任务。
- 引用时不带日期与版本:基准在演进(换题、换口径),不带 as-of 信息的分数会随时间失真。
7. 下一步
- 发布会基准图的完整读法:《怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预》。
- HLE 被用作对比项的实例:《OpenAI 生态 9-02 速报:Anthropic 发布 Claude Fable 5.1 / Mythos 5.1,基准表含 GPT-5.6 Sol》。
- 深度研究的质量控制总纲:《DeepResearch 输出质量控制:模型选型 + Prompt 调优 + 引用验证》。
关键要点
- HLE 定稿 2,500 道跨学科考题(2025-04-03):bug bounty 标记的问题与可搜索问题已被移除替换——这是它区别于'网络可查题库'的核心设计
- 学术背书:2026-01-28 发表于 Nature(Nature 649, 1139–1146);数据集 cais/hle、含 Arxiv 论文与 GitHub 仓库
- 动态版 HLE-Rolling(2025-10-08 上线):持续更新的题目形态,配实时提交看板——静态版成绩与 Rolling 成绩不可混用
- 双口径记分:无工具(no tools)与带工具(with tools)成绩要分开引用,同模型可差 4 个百分点以上
- 模型发布会引用实例:2026-09-01 Claude Fable 5.1 公告表中,HLE 无工具 60.9% / 带工具 65.0%,未报 GPT-5.6 Sol 成绩(缺列是未报不是落后)
- 正确姿势:HLE 是前沿难度参照之一,选型决策应与真实任务基准(领域数据、自建评测)结合,不单看任何单一基准
常见问题
官方参考
相关文章
测量前沿实验室里的 AI 研发速度:Anthropic 的三项自报指标解读
Anthropic 9-17 发布三项内部测量:研发自动化指数(Claude 主导 26% 的 AI 研发、九成以上工作达协作级)、智能体监督(超十亿决策 0.002% 被拦)与安全算力份额(约 6% / 12%)——附完整方法论与官方自认局限。
阅读全文怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预
模型发布会的 accuracy-vs-cost 图和对比表自带口径选择。用 2026-09-01 的 Claude Fable 5.1 发布公告做实例,拆解 8 个阅读要点:effort 曲线、对数轴、误差范围、partial/strict 记分、缺列、安全干预计零分、自建 setup 与公共榜差异。
阅读全文Deep Research 多模型实战:GPT-5.6 vs Claude 4.5 vs Gemini 2.5 + 第三方研究工具对比
Deep Research(深度研究)在 GPT-5.6 / Claude 4.5 / Gemini 2.5 三家模型下的表现对比 + 与 Elicit / Consensus / Perplexity 等第三方研究工具的差异化定位。选哪个 DR、什么时候用第三方工具,文末给决策表。
阅读全文订阅 GPTMap Weekly
每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。
提交后将在新标签页打开 Buttondown 完成订阅确认。