超越化学问答:利用模块化化学操作评估 LLM 的化学推理能力
人工智能
2026-01-08 v3
摘要
尽管具有思维链(CoT)推理能力的大语言模型(LLM)在数学和编程方面表现出色,但其在化学领域进行系统推理的潜力仍未被发掘,而该领域在药物设计和反应工程等实际任务中要求严格的结构分析。当前的基准测试侧重于简单的知识检索,忽略了分子优化和反应预测等复杂任务所需的逐步推理。为了解决这一问题,我们引入了 ChemCoTBench,这是一个将分子结构理解与受算术启发的操作(包括加法、删除和替换)相结合的推理框架,将化学问题求解形式化为透明、逐步的工作流程。通过将分子转换视为模块化的“化学操作”,该框架实现了慢思考推理,类似于数学证明的逻辑,同时将解决方案立足于现实世界的化学约束。我们在两个高影响力任务上评估模型:分子属性优化和化学反应预测。这些任务反映了现实世界的挑战,同时提供了结构化的可评估性。通过提供标注数据集、推理分类法和基线评估,ChemCoTBench 弥合了抽象推理方法与实际化学发现之间的差距,为推进 LLM 作为人工智能驱动的科学创新工具奠定了基础。
引用
@article{arxiv.2505.21318,
title = {Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations},
author = {Hao Li and He Cao and Bin Feng and Yanjun Shao and Xiangru Tang and Zhiyuan Yan and Li Yuan and Yonghong Tian and Yu Li},
journal= {arXiv preprint arXiv:2505.21318},
year = {2026}
}
备注
Accepted by NeurIPS 2025 Dataset Track, 22 pages, 10 figures