中文

AblationBench:用于经验人工智能研究中自动化实验设计评估的基准套件

计算与语言 2026-02-03 v2 人工智能

摘要

语言模型代理日益用于自动化科学研究,但对其科学贡献的评估仍是一个挑战。获取此类见解的关键机制之一是通过消除实验。为此,我们介绍AblationBench,这是一个用于评估代理在经验人工智能研究中消除计划任务的基准套件。它包括两个任务:AuthorAblation旨在根据方法章节提出消除实验,包含83个实例;ReviewerAblation旨InList论文中查找缺失的消除实验,包含350个实例。对于这两个任务,我们开发了基于语言模型的评判器,作为自动化评估框架。我们的实验使用前沿语言模型显示,这些任务仍具有挑战性,最佳-performing LM系统平均仅识别了38%的原始消除实验,低于人类水平。我们观察到作者任务和审稿人任务之间呈现反向性能趋势,这我们归因于模型 grounding 的差异。最后,我们分析了当前语言模型在这些任务中的局限性,发现链式思考提示在代理方法中性能更佳。我们的数据可在https://huggingface.co/collections/ai-coscientist/ablationbench获取,代码可在https://github.com/ai-scientist-bench/ablation-bench获取。

关键词

引用

@article{arxiv.2507.08038,
  title  = {AblationBench: Evaluating Automated Planning of Ablations in Empirical AI Research},
  author = {Talor Abramovich and Gal Chechik},
  journal= {arXiv preprint arXiv:2507.08038},
  year   = {2026}
}

备注

Project page: https://ablation-bench.github.io/