中文

MolQuest:用于智能体评估化学结构鉴定中归纳推理基准

计算与语言 2026-03-27 v1 人工智能

摘要

大型语言模型(LLMs)在推动科学发现方面具有巨大潜力,但其在现实科研情境下动态推理的系统性评估仍有限。当前的科学评估基准主要依赖于静态、单轮问答(QA)格式,无法衡量模型在需要多步骤迭代和实验互动的复杂科学任务中的表现。为填补这一空白,我们引入MolQuest,一个基于真实化学实验数据构建的分子结构鉴定智能体评估框架。与现有数据集不同,MolQuest将分子结构鉴定形式化为多轮交互式任务,要求模型主动规划实验步骤、整合异构光谱数据(如NMR、MS),并不断细化结构假设。该框架系统评估LLMs在广阔复杂化学空间中的归纳推理和战略决策能力。经验结果表明,当前前沿模型在真实科学情境下表现显著受限:令人瞩目的的是,甚至最先进(SOTA)模型的准确率仅约50%,而大多数其他模型的表现低于30%。本工作提供了一个可复现可扩展的科学导向LLM评估框架,我们的发现凸显了当前LLMs在战略科学推理方面的关键缺口,为未来致力于AI能主动参与科学过程的研究设定了明确方向。

关键词

引用

@article{arxiv.2603.25253,
  title  = {MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation},
  author = {Taolin Han and Shuang Wu and Jinghang Wang and Yuhao Zhou and Renquan Lv and Bing Zhao and Wei Hu},
  journal= {arXiv preprint arXiv:2603.25253},
  year   = {2026}
}