盒式训练房:自动化实验设计与模型发现的基准
机器学习
2025-10-16 v2 人工智能
摘要
理解世界并用科学理论加以解释是人工智能研究的核心目标。提出理论、设计实验以检验,然后根据数据修订理论,是科学发现的基本过程。尽管大型语言模型 (LLM) 基于科学代理具有巨大的潜力,但尚无基准系统性测试 LLM 提出科学模型、收集实验数据并根据新数据修订的能力。我们引入 BoxingGym,一个包含 10 个环境的基准,用于系统评估实验设计(例如收集数据以检验科学理论)和模型发现(例如提出和修订科学理论)。为实现可计算和定量评估,我们将每个环境实现为可与科学代理交互运行的生成概率模型。这些概率模型来源于心理学、生态学等多个真实世界科学领域。为定量评估科学代理收集信息性实验数据的能力,我们计算预期信息增益 (EIG),即衡量实验如何减少关于生成模型参数不确定性的量。好的科学理论是简洁且具有预测力的解释。因此,我们要求科学代理解释其模型,然后评估该解释是否使另一科学代理能够就该环境作出可靠预测。除基于解释的评估外,我们还计算诸如预测误差等标准模型评估指标。我们发现,当前的大型语言模型,如 GPT-4o,在实验设计和模型发现方面表现不佳。我们发现,为大型语言模型代理添加显式统计模型并不一定能可靠地改善这些结果。
引用
@article{arxiv.2501.01540,
title = {BoxingGym: Benchmarking Progress in Automated Experimental Design and Model Discovery},
author = {Kanishk Gandhi and Michael Y. Li and Lyle Goodyear and Agam Bhatia and Louise Li and Aditi Bhaskar and Mohammed Zaman and Noah D. Goodman},
journal= {arXiv preprint arXiv:2501.01540},
year = {2025}
}
备注
KG and MYL contributed equally