Curie: 面向严谨自动化科学实验的 AI 代理框架
人工智能
2025-02-27 v2 机器学习
摘要
科学实验是人类进步的基石,要求严谨可靠、方法论控制和可解释性以产生有意义结果。尽管大型语言模型 (LLMs) 在自动化科学过程的不同方面展现出日益增强的能力,但自动化严谨的实验仍是一个重大挑战。为解决这一差距,我们提出 Curie,一个旨在通过三个关键组件将严谨性嵌入实验过程的 AI 代理框架:内代理严谨模块以增强可靠性、代理间严谨模块以维护方法论控制以及实验知识模块以增强可解释性。为评估 Curie,我们设计了一个新颖的实验基准,包含 46 个问题,涵盖四个计算机科学领域,源自具有影响力的研究论文和广泛采用的数据集。与测试的最强基线相比,我们在正确回答实验问题方面实现了 3.4 的改进。Curie 已开源于 https://github.com/Just-Curieous/Curie。
引用
@article{arxiv.2502.16069,
title = {Curie: Toward Rigorous and Automated Scientific Experimentation with AI Agents},
author = {Patrick Tser Jern Kon and Jiachen Liu and Qiuyi Ding and Yiming Qiu and Zhenning Yang and Yibo Huang and Jayanth Srinivasa and Myungjin Lee and Mosharaf Chowdhury and Ang Chen},
journal= {arXiv preprint arXiv:2502.16069},
year = {2025}
}
备注
21 pages