oMeBench:面向有机机制判别与推理的鲁棒基准测试
人工智能
2026-05-05 v3 计算与语言
摘要
有机反应机制是由原料形成中间体和生成物的逐步 elementary 反应组成的,构成理解化学活性和设计新分子与新反应的基础。尽管大型语言模型(LLMs)在理解化学任务(如合成设计)方面显示出前景,但尚不清楚这是否反映出真正的化学推理能力,即生成有效中间体、保持化学一致性以及遵循逻辑连贯的多步骤路径。为此,我们提出了 oMeBench——第一个大规模、由专家精选的有机机制推理基准测试数据集。它包含超过 10,000 条带有中间体、类型标签和难度评分的注释机制步骤。此外,为更精确地评估 LLM 的能力并实现细粒度评分,我们提出了 oMeS,一种结合步骤级逻辑与化学相似性的动态评估框架。我们分析了最先进的 LLM 的性能,结果显示虽然当前模型展现出有前景的化学直觉,但在正确且一致的多步骤推理方面仍存在挑战。值得注意的是,使用提示策略和在我们提出的数据集上对专家模型进行微调后,性能相较于领先的闭源模型提升了约 50%。我们希望 oMeBench 能为推动 AI 系统向真正的化学推理迈进提供严谨的基础。
引用
@article{arxiv.2510.07731,
title = {oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning},
author = {Ruiling Xu and Yifan Zhang and Qingyun Wang and Carl Edwards and Heng Ji},
journal= {arXiv preprint arXiv:2510.07731},
year = {2026}
}
备注
We need adjust some authorship