中文

EAIRA:评估AI模型作为科学研究助理的方法论

人工智能 2025-02-28 v1

摘要

近期发展使AI,特别是大型语言模型(LLM),成为科学研究的变革性工具,能够解决需要推理、问题解决和决策的复杂任务。其卓越的能力表明其作为科学研究助理的潜力,但也凸显了需要进行全面、严格且领域特定的评估,以 Assess其在现实科学应用中的有效性。这篇论文描述了在阿拉斯高国家实验室开发的用于评估AI模型作为科学研究助理(EAIRA)的多方位方法论。该方法论包含四类主要评估:1)多选题,用于评估事实记忆;2)开放式回答,用于评估高级推理和问题解决能力;3)实验室风格实验,涉及对受控环境中研究助理能力进行详细分析;4)现场风格实验,捕捉研究人员与LLM在广泛科学领域和应用中的规模交互。这些互补方法使我们能够全面分析LLM在科学知识、推理能力和适应性方面的优势和不足。鉴于LLM发展的快速进程,我们设计了该方法论以不断演化和适应,以确保其持续的相关性和适用性。本文描述的是2025年2月底的方法论状态。虽然在科学子领域内开发了该方法论,但该方法论旨在适用于广泛的科学领域。

关键词

引用

@article{arxiv.2502.20309,
  title  = {EAIRA: Establishing a Methodology for Evaluating AI Models as Scientific Research Assistants},
  author = {Franck Cappello and Sandeep Madireddy and Robert Underwood and Neil Getty and Nicholas Lee-Ping Chia and Nesar Ramachandra and Josh Nguyen and Murat Keceli and Tanwi Mallick and Zilinghan Li and Marieme Ngom and Chenhui Zhang and Angel Yanguas-Gil and Evan Antoniuk and Bhavya Kailkhura and Minyang Tian and Yufeng Du and Yuan-Sen Ting and Azton Wells and Bogdan Nicolae and Avinash Maurya and M. Mustafa Rafique and Eliu Huerta and Bo Li and Ian Foster and Rick Stevens},
  journal= {arXiv preprint arXiv:2502.20309},
  year   = {2025}
}

备注

33 pages, 18 figures