衡量 AI 完成长期软件任务的能力
人工智能
2026-02-26 v3 机器学习
摘要
尽管 AI 基准测试进展迅速,但基准测试表现在实际中的含义仍不明确。为了量化 AI 系统相对于人类的能力,我们提出了一种新的度量指标:50%-任务完成时间范围。这是人类通常完成 AI 模型能以 50% 成功率完成的任务所需的时间。我们首先让具有相关领域专业知识的人员在 RE-Bench、HCAST 以及 66 个新颖的较短任务上进行计时。在这些任务上,当前前沿 AI 模型如 Claude 3.7 Sonnet 的 50% 时间范围约为 50 分钟。此外,前沿 AI 的时间范围自 2019 年以来大约每七个月翻一番,尽管这一趋势在 2024 年可能加速。AI 模型时间范围的增加似乎主要由更高的可靠性和适应错误的能力,以及更好的逻辑推理和工具使用能力共同驱动。我们讨论了结果的局限性——包括其外部效度的程度——以及自主性增强对危险能力的启示。如果这些结果推广到真实世界的软件任务,对这一趋势的外推预测在五年内,AI 系统将能够自动化许多目前需要人类一个月才能完成的软件任务。
引用
@article{arxiv.2503.14499,
title = {Measuring AI Ability to Complete Long Software Tasks},
author = {Thomas Kwa and Ben West and Joel Becker and Amy Deng and Katharyn Garcia and Max Hasin and Sami Jawhar and Megan Kinniment and Nate Rush and Sydney Von Arx and Ryan Bloom and Thomas Broadley and Haoxing Du and Brian Goodrich and Nikola Jurkovic and Luke Harold Miles and Seraphina Nix and Tao Lin and Neev Parikh and David Rein and Lucas Jun Koba Sato and Hjalmar Wijk and Daniel M. Ziegler and Elizabeth Barnes and Lawrence Chan},
journal= {arXiv preprint arXiv:2503.14499},
year = {2026}
}