HCAST:面向人类校准的自主软件任务
人工智能
2025-03-24 v1
摘要
为了理解和预测高度自主 AI 系统的社会影响,我们需要具备 grounding 能力的基准,即直接将 AI 性能与我们关心的实际影响联系起来的指标。我们提出了 HCAST(Human-Calibrated Autonomy Software Tasks),这是一个包含 189 个机器学习工程、网络安全、软件工程和通用推理任务的基准测试。我们收集了 563 个人类基准(总计超过 1500 小时),来自在这些领域中具有专业技能的人士,他们在与 AI 代理相同的条件下工作,这让我们得以估计 HCAST 任务需要的人类在一分钟到 8+ 小时之间完成。测量人类完成任务所需的时间,为评估 AI 能力提供了直观的指标,帮助回答“代理能否在人类需要 X 小时完成的任务上值得信赖?”我们评估了基于前沿基础模型构建的 AI 代理的成功率,我们发现当前代理在需要人类不到一小时的任务上成功率为 70-80%,而在需要人类超过 4 小时的任务上成功率不足 20%。
引用
@article{arxiv.2503.17354,
title = {HCAST: Human-Calibrated Autonomy Software Tasks},
author = {David Rein and Joel Becker and Amy Deng and Seraphina Nix and Chris Canal and Daniel O'Connel and Pip Arnott and Ryan Bloom and Thomas Broadley and Katharyn Garcia and Brian Goodrich and Max Hasin and Sami Jawhar and Megan Kinniment and Thomas Kwa and Aron Lajko and Nate Rush and Lucas Jun Koba Sato and Sydney Von Arx and Ben West and Lawrence Chan and Elizabeth Barnes},
journal= {arXiv preprint arXiv:2503.17354},
year = {2025}
}
备注
32 pages, 10 figures, 5 tables