ChemVA:推动大语言模型理解化学反应图的能力
人工智能
2026-05-19 v1 计算与语言
计算机视觉与模式识别
摘要
尽管大语言模型 (LLM) 在科学文本处理方面取得了革命性进展,但在解释化学反应图方面仍存在显著能力差距。我们确定了限制当前系统的两个根本性瓶颈:视觉缺陷,通用视觉编码器难以解决密集分子图的严格拓扑连通性;语义脱节,标准线性字符串(如 SMILES)无法有效激活模型的潜在化学推理。为弥合这些差距,我们提出化学视觉激活 (ChemVA) 框架,采用视觉锚定机制通过混合粒度检测将功能基团 grounding,然后采用语义对齐方法将视觉特征转换为实体名称,以最大化 LLM 的知识激活。我们在 OCRD-Bench 上进行评估,该数据集包含密集的视觉-语义上下文并涵盖反应全覆盖,以评估从识别到推理的完整光谱。在 OCRD-Bench 上的大量实验表明,ChemVA 实现了 92.0% 的结构识别准确率。通过桥接视觉和语义瓶颈,我们的框架在 9 个 diverse LLM 上实现了约 20 个百分点的持续性能提升,使 open-weight 模型能够与专有 SOTA 系统在复杂化学推理任务中相抗衡。
引用
@article{arxiv.2605.17214,
title = {ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding},
author = {Mingyang Rao and Kehua Feng and Zhihui Zhu and Jiangzhen Fu and Hao Yu and Keyan Ding and Huajun Chen},
journal= {arXiv preprint arXiv:2605.17214},
year = {2026}
}