中文

SUPERChem:化学中的多模态推理基准

计算与语言 2025-12-02 v1 人工智能 机器学习

摘要

当前用于评估大语言模型(LLM)化学推理能力的基准存在诸多局限:任务过于简化、缺乏过程级评估,以及与专家水平化学技能不匹配。为此,我们引入 SUPERChem,一个包含500个专家精选的推理密集型化学问题的基准,覆盖多个子领域,提供多模态和文本-only两种格式。原创内容及迭代式挑选流程消除有缺陷的题目并缓解数据污染。每道题目配有专家撰写的解题路径,支持基于推理路径忠诚度(RPF)的评分,以评估超越最终答案准确性的推理质量。针对人类基线的40.3%准确率进行评估显示,最佳表现模型 GPT-5(High)仅达38.5%,其后紧随的 Gemini 2.5 Pro(37.9%)和 DeepSeek-V3.1-Think(37.3%)。SUPERChem 诱发多步骤、多模态推理,揭示了视觉信息对模型的影响,区分了高忠诚度推理者与启发式推理者。通过提供具有挑战性的基准和可靠的评估框架,SUPERChem 旨�推动大语言模型向专家水平的化学智能发展。该基准的数据集可在 https://huggingface.co/datasets/ZehuaZhao/SUPERChem 获取。

关键词

引用

@article{arxiv.2512.01274,
  title  = {SUPERChem: A Multimodal Reasoning Benchmark in Chemistry},
  author = {Zehua Zhao and Zhixian Huang and Junren Li and Siyu Lin and Junting Zhou and Fengqi Cao and Kun Zhou and Rui Ge and Tingting Long and Yuexiang Zhu and Yan Liu and Jie Zheng and Junnian Wei and Rong Zhu and Peng Zou and Wenyu Li and Zekai Cheng and Tian Ding and Yaxuan Wang and Yizhao Yan and Tingru Wei and Haowei Ming and Weijie Mao and Chen Sun and Yiming Liu and Zichen Wang and Zuo Zhang and Tong Yang and Hao Ma and Zhen Gao and Jian Pei},
  journal= {arXiv preprint arXiv:2512.01274},
  year   = {2025}
}

备注

35 pages, 11 figures, 5 tables