中文

BRIDGE:从模型性能预测人类任务完成时间

人工智能 2026-02-10 v1 计算与语言 机器学习

摘要

评估AI系统在真实世界中的能力,需要将基准性能锚定于人类可解释的任务难度度量。现有方法依赖直接的人类任务完成时间标注,成本高昂、噪声大且难以跨基准规模化。在本工作中,我们提出BRIDGE,一个统一的心理测量框架,从模型响应中学习潜在难度尺度并将其锚定于人类任务完成时间。我们采用两参数逻辑项目反应模型(IRT),联合估计潜在任务难度与模型能力。我们展示,潜在任务难度与人类完成时间的对数arithm 呈线性关系,允许仅凭模型性能推断新基准的人类任务完成时间。借助这一对齐方式,我们以人类任务长度预测前沿模型能力,并独立复现METR的指数比例结果,50%可解答任务的时程约每6个月翻倍一次。

关键词

引用

@article{arxiv.2602.07267,
  title  = {BRIDGE: Predicting Human Task Completion Time From Model Performance},
  author = {Fengyuan Liu and Jay Gala and Nilaksh and Dzmitry Bahdanau and Siva Reddy and Hugo Larochelle},
  journal= {arXiv preprint arXiv:2602.07267},
  year   = {2026}
}