中文

从人类水平 AI 故事到 AI 衡量人类尺度

机器学习 2026-04-08 v2

摘要

将 AI 模型与“人类水平”进行比较往往会产生误导,因为基准得分之间难以衡量,或人类基准来自狭窄人群。为此,我们提出一种框架,对题目进行校准,使其针对“全球人口”,并在基于人类的统一尺度上报告性能。具体而言,我们基于不同能力水平的比例尺构建框架,其中每个水平应代表整个世界人群在对数尺度(基数为 BB)上的成功概率。我们通过整合公开的人类测试数据(涵盖 PISA、TIMSS、ICAR、UKBioBank 和 ReliabilityBench 等教育与推理基准),为每种能力(推理、理解、知识、量化等)校准比例尺。基数 BB 通过使用 LLM 在两个人口统计轮廓之间进行外推来估计,假设它们能浓缩关于人口的丰富信息。我们采用分组切片和后比例分配等技术评估不同映射的质量。新技术允许相对于整个世界人口的尺度进行校准和标准化。

关键词

引用

@article{arxiv.2602.18911,
  title  = {From Human-Level AI Tales to AI Leveling Human Scales},
  author = {Peter Romero and Fernando Martínez-Plumed and Zachary R. Tidler and Matthieu Téhénan and Sipeng Chen and Álvaro David Gómez Antón and Luning Sun and Manuel Cebrian and Lexin Zhou and Yael Moros Daval and Daniel Romero-Alvarado and Félix Martí Pérez and Kevin Wei and José Hernández-Orallo},
  journal= {arXiv preprint arXiv:2602.18911},
  year   = {2026}
}

备注

23 pages, 10 figures. submitted to ICML 2026