用语言模型预测实证AI研究结果
人工智能
2025-06-03 v1
摘要
AI研究中许多看似前景广阔的想法最终未能奏效,而验证它们需要耗费大量人力和计算资源。因此,预测想法的成功概率对于加速实证AI研究至关重要,这是一项连专家研究员也需要大量经验才能掌握的技能。我们构建了首个用于该任务的基准测试,并比较了语言模型与人类专家的表现。具体而言,给定两个研究想法(例如两种越狱方法),我们的目标是预测哪个在一组基准测试上表现更好。我们从会议论文中抓取了想法和实验结果,得到了1,585对经人工验证、在我们基础模型截止日期后发布的想法对用于测试,以及6,000对用于训练。随后,我们开发了一个结合微调GPT-4.1与论文检索智能体的系统,并招募了25位人类专家进行对比。在NLP领域,我们的系统以大幅优势击败了人类专家(64.4%对48.9%)。在完整测试集上,我们的系统达到了77%的准确率,而像o3这样的现成前沿语言模型即使配备相同的检索增强,表现也不比随机猜测更好。我们通过大量人工编写和语言模型设计的鲁棒性测试,验证了我们的系统并未利用想法复杂性等表面特征。最后,我们在未发表的新颖想法上评估了我们的系统,包括由AI构思智能体生成的想法。我们的系统达到了63.6%的准确率,展现了其作为奖励模型以改进想法生成模型的潜力。总而言之,我们的结果为语言模型加速实证AI研究勾勒出了一个极具前景的新方向。
引用
@article{arxiv.2506.00794,
title = {Predicting Empirical AI Research Outcomes with Language Models},
author = {Jiaxin Wen and Chenglei Si and Yueh-han Chen and He He and Shi Feng},
journal= {arXiv preprint arXiv:2506.00794},
year = {2025}
}