中文

MOOSE-Chem2:通过分层搜索探索大语言模型在细粒度科学假设发现中的极限

计算与语言 2025-10-28 v2 人工智能 计算工程、金融与科学 机器学习

摘要

大语言模型(LLM)在自动化科学假设生成方面展现了潜力,然而现有方法主要产生缺乏关键方法论和实验细节的粗粒度假设。我们引入并正式定义了细粒度科学假设发现这一新任务,该任务旨在从粗略的初始研究方向生成详细的、实验上可操作的假设。我们将其构建为一个组合优化问题,并在最大程度利用 LLM 的情况下研究其解决该问题的能力上限。具体而言,我们探索了四个基础问题:(1)如何最好地利用 LLM 的内部启发式规则,基于其自身内部评分,使其在所有可能生成的假设中构建出它自身判断为最有希望的细粒度假设——从而在假设空间上定义一个潜在奖励景观;(2)这种被 LLM 判定为更好的假设是否与真实假设表现出更强的一致性;(3)使用由具有相似能力的多样化 LLM 组成的集成来塑造奖励景观,是否比使用其中最强 LLM 的重复实例来定义它产生更好的结果;(4)由相同 LLM 组成的集成是否比单个 LLM 提供更可靠的奖励景观。为了解决这些问题,我们提出了一种分层搜索方法,该方法逐步提出并将细节整合到假设中,从一般概念推进到具体的实验配置。我们表明,这种分层过程平滑了奖励景观并实现了更有效的优化。在基于近期文献中专家标注的细粒度假设的新基准上的经验评估表明,我们的方法始终优于强基线。

关键词

引用

@article{arxiv.2505.19209,
  title  = {MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search},
  author = {Zonglin Yang and Wanhao Liu and Ben Gao and Yujie Liu and Wei Li and Tong Xie and Lidong Bing and Wanli Ouyang and Erik Cambria and Dongzhan Zhou},
  journal= {arXiv preprint arXiv:2505.19209},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025