中文

AbGen:评估大语言模型在科学研究消融实验设计与评估中的能力

计算与语言 2025-07-18 v1 人工智能

摘要

我们提出 AbGen,这是首个用于评估大语言模型(LLM)在科学研究中设计消融实验能力的基准。AbGen 包含 1,500 个专家标注样本,这些样本源自 807 篇 NLP 论文。在该基准中,大语言模型的任务是根据给定的研究背景,为指定的模块或过程生成详细的消融实验设计。我们对 DeepSeek-R1-0528 和 o4-mini 等主流大语言模型的评估表明,这些模型与人类专家在消融实验设计的重要性、忠实性和合理性方面存在显著的性能差距。此外,我们证明现有的自动化评估方法对我们的任务并不可靠,因为它们与人类评估相比存在显著差异。为了更好地研究这一问题,我们构建了 AbGen-Eval,这是一个元评估基准,旨在评估常用自动化评估系统在衡量大语言模型在该任务上表现的可靠性。我们在 AbGen-Eval 上研究了多种 LLM-as-Judge 系统,为未来开发更有效、更可靠、面向复杂科学任务的基于大语言模型的评估系统提供了启示。

关键词

引用

@article{arxiv.2507.13300,
  title  = {AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research},
  author = {Yilun Zhao and Weiyuan Chen and Zhijian Xu and Manasi Patwardhan and Yixin Liu and Chengye Wang and Lovekesh Vig and Arman Cohan},
  journal= {arXiv preprint arXiv:2507.13300},
  year   = {2025}
}

备注

ACL 2025