中文

AAAR-1.0:评估 AI 在科研中的潜能

计算与语言 2025-05-27 v4

摘要

众多研究评估了 AI 系统(尤其是大型语言模型 LLMs)在促进日常任务(如邮件写作、问答和创意内容生成)方面的熟练程度。然而,研究人员在利用 LLMs 进行自身工作时面临独特的挑战和机遇,例如构思研究想法、设计实验和撰写或审阅论文。本研究引入 AAAR-1.0,一个基准数据集,用于评估 LLM 在三个基本、专业强度研究任务中的性能:(i)EquationInference,基于论文提交的上下文信息评估方程的正确性;(ii)ExperimentDesign,设计验证研究想法和解决方案的实验;(iii)PaperWeakness,识别论文提交中的缺陷;以及 (iv) REVIEWCRITIQUE,识别人类评论中每个片段是否不足。AAAR-1.0 不同于先前基准的两个关键方式:首先,它明确以研究为导向,涉及需要深层专业知识的任务;其次,它以研究人员为导向,镜像了研究人员在日常活动中所从事的主要活动。对开源和专有 LLM 的评估揭示了其在进行复杂研究任务方面的潜能及限制。我们将持续迭代 AAAR-1.0 以适应新版本。

关键词

引用

@article{arxiv.2410.22394,
  title  = {AAAR-1.0: Assessing AI's Potential to Assist Research},
  author = {Renze Lou and Hanzi Xu and Sijia Wang and Jiangshu Du and Ryo Kamoi and Xiaoxin Lu and Jian Xie and Yuxuan Sun and Yusen Zhang and Jihyun Janice Ahn and Hongchao Fang and Zhuoyang Zou and Wenchao Ma and Xi Li and Kai Zhang and Congying Xia and Lifu Huang and Wenpeng Yin},
  journal= {arXiv preprint arXiv:2410.22394},
  year   = {2025}
}

备注

ICML 2025. Project Webpage: https://renzelou.github.io/AAAR-1.0/