中文

ChemVTS-Bench:评估多模态大语言模型在化学中的视觉-文本-符号推理能力

人工智能 2025-11-25 v1

摘要

化学推理本质上融合了视觉、文本和符号三种模态,而现有基准数据集很少能捕捉这种复杂性,往往仅依赖简单图像-文本配对且化学语义有限。因此,多模态大语言模型(MLLMs)在跨模态处理和整合化学意义信息方面的实际能力仍不清晰。我们提出了 \textbf{ChemVTS-Bench},一个基于领域真实感的基准数据集,旨在系统评估 MLLMs 的视觉-文本-符号(VTS)推理能力。ChemVTS-Bench 包含多样且具挑战性的化学问题,涵盖有机分子、无机材料和 3D 晶体结构,每项任务以三种互补的输入模式呈现:(1)视觉单模态,(2)视觉-文本混合,(3)基于 SMILES 的符号输入。这种设计 enables 对模态依赖的推理行为和跨模态整合进行细粒度分析。为确保严谨且可复现的评估,我们进一步开发了基于自动化智能体的工作流程,对推理过程进行标准化、答案验证以及故障模式诊断。大量实验表明,视觉单模态输入仍具挑战性,结构化化学是最难的领域,多模态融合虽能缓解但未能消除视觉误差、知识性误差或逻辑误差,这凸显了 ChemVTS-Bench 作为推进多模态化学推理领域的严谨且符合领域特征的测试平台。所有数据和代码将公开,以支持未来研究。

关键词

引用

@article{arxiv.2511.17909,
  title  = {ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry},
  author = {Zhiyuan Huang and Baichuan Yang and Zikun He and Yanhong Wu and Fang Hongyu and Zhenhe Liu and Lin Dongsheng and Bing Su},
  journal= {arXiv preprint arXiv:2511.17909},
  year   = {2025}
}