AutoDiscovery:通过贝叶斯惊讶进行开放式科学发现
机器学习
2026-02-13 v3 人工智能
计算与语言
摘要
自主科学发现(ASD)的承诺不仅在于回答问题,更在于知道该提出哪些问题。目前大多数 ASD 研究工作都探索利用大型语言模型(LLM)在目标导向的情境下进行推理,依赖人类指定的研究问题来指导假设生成。然而,科学发现可以通过允许 AI 系统依据自身标准驱动探索来进一步加速。少数现有方法在开放式 ASD 中基于多样性启发式或主观的人类有趣性代理来选择假设,但前者在面对通常庞大的假设空间时难以有意义地导航,后者则受限于定义不够精确。本文提出 AutoDiscovery——一种用于开放式 ASD的方法,其通过贝叶斯惊讶驱动科学探索。我们量化了从 LLM 对假设其先验信念到在收集实验结果后对其后验信念的预期位移。为高效地探索嵌套假设的空间,我们的方法采用蒙特卡洛树搜索(MCTS)策略,并以惊讶值作为奖励函数进行逐步扩张。我们在横跨生物学、经济学、金融学和行为科学等21个真实世界数据集上进行数据驱动的发现评估。我们的结果表明,在固定预算下,AutoDiscovery 通过产生5-29%更多被 LLM 认为惊讶的发现,显著优于竞争方法。我们的人员评估进一步表明,我们系统产生的发现中有三分之二也被领域专家所惊讶,这表明这是一个重要的步骤,朝向构建开放式 ASD 系统的目标迈进。
引用
@article{arxiv.2507.00310,
title = {AutoDiscovery: Open-ended Scientific Discovery via Bayesian Surprise},
author = {Dhruv Agarwal and Bodhisattwa Prasad Majumder and Reece Adamson and Megha Chakravorty and Satvika Reddy Gavireddy and Aditya Parashar and Harshit Surana and Bhavana Dalvi Mishra and Andrew McCallum and Ashish Sabharwal and Peter Clark},
journal= {arXiv preprint arXiv:2507.00310},
year = {2026}
}
备注
Accepted to NeurIPS 2025: https://neurips.cc/virtual/2025/loc/san-diego/poster/116398