中文

ReactBench:化学反应图上多模态大语言模型拓扑推理基准

人工智能 2026-04-24 v2

摘要

多模态大语言模型(MLLMs)在识别单个视觉元素和对简单线性图进行推理方面表现出色。然而,当面对涉及分支路径、汇聚流和循环依赖的复杂拓扑结构时,其推理能力会急剧下降,哪怕是基本的数点任务。现有基准测试未能探究这一差距,主要关注语义理解而非结构推理。我们引入ReactBench,一个揭示结构推理根本局限的基准测试。这些真实世界的科学图图天然涵盖了从线性链到循环图的多样化结构,同时需要精确的局部识别和连贯的全局推理。我们的基准测试包含1,618个专家标注的问答对,覆盖四个分层任务维度。广泛评估了17个MLLMs,发现锚点任务与整体结构推理任务之间存在超过30%的显著性能差距。受控消融实验确认,这一瓶颈来自推理能力,而非感知能力。这发现了结构理解的根本缺陷,并为推进视觉推理指明了方向。

关键词

引用

@article{arxiv.2604.15994,
  title  = {ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams},
  author = {Qiang Xu and Shengyuan Bai and Yu Wang and He Cao and Leqing Chen and Yuanyuan Liu and Bin Feng and Zijing Liu and Yu Li},
  journal= {arXiv preprint arXiv:2604.15994},
  year   = {2026}
}