RxnCaption:将反应图解析问题 reformulate 为受视觉提示引导的图像描述
计算机视觉与模式识别
2026-01-07 v2
摘要
大规模化学反应数据集是化学领域人工智能研究的关键要素。然而,现有的化学反应数据常以图像形式存在于论文中,难以被机器读取,无法用于训练机器学习模型。为此,我们提出了 RxnCaption 框架,用于化学反应图解析 (RxnDP) 任务。我们的框架将传统由坐标预测驱动的解析过程 reformulate 为图像描述问题,这正是大型视觉语言模型 (LVLMs) 能够自然处理的任务。我们引入一种称为 BBox and Index as Visual Prompt (BIVP) 的策略,利用我们研发的领先的分子探测器MolYOLO,在输入图像上直接绘制分子边界框和索引,从而将后续解析转化为自然语言描述问题。大量实验表明,BIVP 策略在显著提升结构提取质量的同时,大大简化了模型设计。我们进一步构建了 RxnCaption-15k 数据集,其规模是现有真实世界文献基准的数量级,并在四种布局原型中保持均衡的测试子集。实验表明,RxnCaption-VL 在多个指标上实现了最先进的性能。我们相信,本方法、数据集和模型将推动化学文献中结构化信息提取,并催化更广泛的化学领域人工智能应用。我们将在 GitHub 上发布数据、模型和代码。
引用
@article{arxiv.2511.02384,
title = {RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning},
author = {Jiahe Song and Chuang Wang and Bowen Jiang and Yinfan Wang and Hao Zheng and Xingjian Wei and Chengjin Liu and Rui Nie and Junyuan Gao and Jiaxing Sun and Yubin Wang and Lijun Wu and Zhenhua Huang and Jiang Wu and Qian Yu and Conghui He},
journal= {arXiv preprint arXiv:2511.02384},
year = {2026}
}