GPTMap

Humanity's Last Exam 深度解读:2,500 道前沿考题的来路与读法

HLE 是目前被引用最多的前沿推理基准:2,500 道跨学科考题、Nature 发表、还有会换题的动态版 HLE-Rolling。拆解它的来路(众包、bug bounty、题目替换史)、双口径记分(无工具/带工具)与正确的引用姿势。

TL;DR
Humanity's Last Exam(HLE)是 Scale AI 与 CAIS 发布的前沿推理基准:2025-04-03 定稿 2,500 道跨学科考题(bug bounty 标记的污染题与可搜索题已移除替换),2026-01-28 发表于 Nature(649, 1139–1146),另有 2025-10-08 上线的动态版 HLE-Rolling 与实时提交看板,数据集为 cais/hle。读 HLE 成绩的三个要点:区分无工具与带工具两种口径(同模型可差 4 个百分点以上);注意动态版会换题、静态版成绩不等于 Rolling 成绩;把 HLE 当'前沿难度参照'而非选型唯一依据——2026-09-01 的 Claude Fable 5.1 公告即以 HLE(无工具 60.9% / 带工具 65.0%)作为对比项之一。
Humanity's Last Exam(HLE)是由 Scale AI 与 Center for AI Safety(CAIS)出品的跨学科前沿推理基准:题目由 500+ 机构、50 国的贡献者提交(以教授、研究人员与研究生学位持有者为主)、覆盖上百个学科,2025-04-03 定稿 2,500 道题,2026-01-28 发表于 Nature,提供静态版与动态版 HLE-Rolling 两种形态,数据集托管于 cais/hle,被主要模型发布会广泛用作推理能力对比项。

操作步骤

  1. 确认口径

    引用任何 HLE 分数前先确认是无工具还是带工具、静态版还是 Rolling 版——四项任一不同即不可比。

  2. 核对缺列

    对比表中某模型的破折号是'未报'不是'落后';需要该模型数据时找其官方发布口径,找不到就留空并注明。

  3. 换算与误差

    同一模型的双口径差可达数个百分点;跨模型比较优先看同一口径内的差距,并结合发布方给出的误差说明。

  4. 用真实任务校验

    把 HLE 定位为推理难度参照,最终选型用领域数据或自建任务集验证——基准分数只是初筛,不是结论。

如果你读模型发布会,几乎绕不开一个名字:Humanity's Last Exam(HLE)。它被主要厂商的公告表列为推理能力对比项,也是"前沿难度"的代名词之一。但大多数引用只给一个百分数——题目从哪来、2,500 题怎么防污染、无工具与带工具两行分数差在哪、动态版意味着什么,很少有人讲。本文基于 HLE 官方站点(2026-09-08 重抓核对)与最新模型发布实例,拆解 HLE 的来路与正确的引用姿势。

1. HLE 是什么:一页简历

HLE 由 Scale AI 与 Center for AI Safety(CAIS)出品,定位是跨学科前沿推理基准——题目由 500+ 机构、50 国的贡献者(以教授、研究人员与研究生学位持有者为主)提交,覆盖上百个学科。三个硬事实:2025-04-03 定稿 2,500 道题;2026-01-28 发表于 Nature(Nature 649, 1139–1146);数据集以 cais/hle 托管,配套 Arxiv 论文、GitHub 仓库与实时提交看板。

2. 题目怎么来的:一套"防检索污染"的设计

HLE 的立身之本不是题难,而是题干净。它的题目来自全球贡献者提交,随后经过一轮完整的质量流程:

  1. 开放补充征集:先向社区广泛收集候选题;
  2. Bug bounty 纠错:社区反馈扩展阶段设立赏金计划,专门标记有缺陷的问题;
  3. 移除可搜索题:被标记的问题、以及"网上能搜到答案"的问题被移除并用其他题目替换;
  4. 定稿:2025-04-03 以 2,500 题定稿。

这套流程回答了一个根本问题:考模型推理,就不能让它能靠搜索作弊。静态题库无论多难,随时间推移都会被逐步"消化"——这正是第 3 节动态版出现的原因。

3. 动态版 HLE-Rolling:给题库"保鲜"

2025-10-08,官方上线动态版本 HLE-Rolling,并配实时提交看板。Rolling 版的题目持续更新,模型"提前背题"的空间被压缩。对使用者的含义:引用 HLE 成绩必须注明是静态版还是 Rolling 版——两者的题目集合不同,分数不可互相比较。它也代表基准评测的一个趋势:重要基准正在从"一次性定稿"走向"持续保鲜"。

4. 成绩怎么读:口径、缺列与对比表

模型发布会引用 HLE 时最常见的三个坑,都能在实例里看到。以 2026-09-01 的 Claude Fable 5.1 公告表为例:

模型无工具带工具
Fable 5.160.9%65.0%
Fable 557.8%63.8%
Opus 556.6%63.6%
GPT-5.6 Sol——

三个读法要点:

  1. 双口径:无工具与带工具是两行独立成绩,同模型相差 4.1 个百分点(Fable 5.1)——引用必须带口径;
  2. 缺列是未报:GPT-5.6 Sol 在 HLE 行是破折号——未报不等于落后,需要时找该模型自己的官方口径;
# 同模型双口径落差(数字取自 2026-09-01 公告表)
fable51_no_tools, fable51_with_tools = 60.9, 65.0
print(f"Fable 5.1 无工具/带工具落差: {fable51_with_tools - fable51_no_tools:.1f} pts")
  1. 对比维度单一:HLE 只测跨学科推理,它不回答编码、长上下文、智能体能力——完整判断需要读整张对比表而非单行。
# HLE 引用自查清单
[ ] 口径:无工具 / 带工具
[ ] 版本:静态版 / HLE-Rolling
[ ] 日期:成绩的 as-of 信息
[ ] 试验次数与判分脚本版本

这套读法的完整版(对数成本轴、误差范围、安全干预计零分等)见《怎么读模型发布里的基准对比图:effort 曲线、对数成本轴与安全干预》。

5. HLE 在深度研究工作流里的位置

对做深度研究的团队,HLE 有两个务实用途:

  • 模型推理档位的参照系:在"前沿难度"这个维度上,HLE 提供了一个跨厂商可比的锚点——用它初筛哪些模型值得进入你的候选池;
  • 评测方法论的参照:它的题目治理流程(bounty 纠错、替换可搜索题、动态保鲜)本身就是自建评测集时可以借鉴的设计模板。

但要守住边界:HLE 测的是推理,不是你的任务。领域数据、真实样例、成本与延迟,这些选型的最终依据任何基准都替代不了(质量控制总纲见《DeepResearch 输出质量控制:模型选型 + Prompt 调优 + 引用验证》)。

6. 常见错误与排查

  • 把无工具与带工具分数混排:4 个百分点的口径差,足够颠倒名次。
  • 静态版与 Rolling 版混比:题目集不同,分数语义不同。
# 引用格式示例(三要素齐全)
Fable 5.1 于 HLE(静态版、带工具)得 65.0%(2026-09-01 公告口径)
  • 把缺列读成落后:破折号 = 未报,不是零分。
  • 只看一个基准下结论:单基准名次是单维度名次;完整判断需要一组基准 + 真实任务。
  • 引用时不带日期与版本:基准在演进(换题、换口径),不带 as-of 信息的分数会随时间失真。

7. 下一步

关键要点

  • HLE 定稿 2,500 道跨学科考题(2025-04-03):bug bounty 标记的问题与可搜索问题已被移除替换——这是它区别于'网络可查题库'的核心设计
  • 学术背书:2026-01-28 发表于 Nature(Nature 649, 1139–1146);数据集 cais/hle、含 Arxiv 论文与 GitHub 仓库
  • 动态版 HLE-Rolling(2025-10-08 上线):持续更新的题目形态,配实时提交看板——静态版成绩与 Rolling 成绩不可混用
  • 双口径记分:无工具(no tools)与带工具(with tools)成绩要分开引用,同模型可差 4 个百分点以上
  • 模型发布会引用实例:2026-09-01 Claude Fable 5.1 公告表中,HLE 无工具 60.9% / 带工具 65.0%,未报 GPT-5.6 Sol 成绩(缺列是未报不是落后)
  • 正确姿势:HLE 是前沿难度参照之一,选型决策应与真实任务基准(领域数据、自建评测)结合,不单看任何单一基准

常见问题

Humanity's Last Exam 由 Scale AI 与 Center for AI Safety(CAIS)出品,定位是跨学科前沿推理基准:题目由 500+ 机构、50 国的贡献者提交(以教授、研究人员与研究生学位持有者为主),覆盖上百个学科。2025-04-03 定稿 2,500 道题,2026-01-28 发表于 Nature(Nature 649, 1139–1146)。数据集以 cais/hle 托管,配套 Arxiv 论文与 GitHub 仓库。

官方参考

相关文章

订阅 GPTMap Weekly

每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。

提交后将在新标签页打开 Buttondown 完成订阅确认。

GPTMap Editorial发布于 2026-09-08 8 分钟阅读
测试环境(EEAT)
最后测试时间:2026-09-08
使用模型:gpt-5.6