Auto-Bench:面向 LLM 科学发现的自动化基准测试
机器学习
2025-02-24 v1 人工智能
摘要
鉴于大型语言模型 (LLM) 的卓越性能,一个重要问题浮现:LLM 能否进行类似人类的科学研究并发现新知识,充当 AI 科学家?科学发现是一个迭代过程,需要高效的知识更新和编码。它涉及理解环境、识别新假设以及对行动进行推理;然而,目前尚不存在专为 LLM 代理设计的科学发现标准基准测试。针对这些限制,我们引入了新的基准测试 \textit{Auto-Bench},涵盖了自然科学和社会科学中评估 LLM 科学发现所必需的方面。我们的基准测试基于因果图发现原则,对模型提出挑战,以揭示隐藏结构并作出最佳决策,包括生成有效的依据。在与 oracle 交互式互动中,模型不断细化对 underlying interactions(化学和社会互动)的理解,通过战略干预实现这一目标。我们评估了包括 GPT-4、Gemini、Qwen、Claude 和 Llama 在内的领先 LLM,发现随问题复杂度的增加表现显著下降,这表明机器智能与人类智能之间存在重要差距,未来的 LLM 发展需要考虑这一点。
引用
@article{arxiv.2502.15224,
title = {Auto-Bench: An Automated Benchmark for Scientific Discovery in LLMs},
author = {Tingting Chen and Srinivas Anumasa and Beibei Lin and Vedant Shah and Anirudh Goyal and Dianbo Liu},
journal= {arXiv preprint arXiv:2502.15224},
year = {2025}
}
备注
13 pages