中文

MolParser:真实场景下分子结构的端到端视觉识别

计算机视觉与模式识别 2025-09-22 v4

摘要

近几十年来,化学出版物和专利数量迅速增长。其中相当一部分关键信息嵌入在分子结构图中,这给大规模文献检索带来了困难,并限制了大型语言模型在生物、化学和制药等领域的应用。精确化学结构的自动提取至关重要。然而,真实世界文档中大量存在的马库什结构,以及分子图像质量、绘制风格和噪声的差异,严重限制了现有光学化学结构识别(OCSR)方法的性能。我们提出了MolParser,这是一种新颖的端到端OCSR方法,能够高效、准确地从真实世界文档中识别化学结构,包括复杂的马库什结构。我们使用一种扩展的SMILES编码规则来标注我们的训练数据集。基于此规则,我们构建了据我们所知最大的标注分子图像数据集MolParser-7M。在利用大量合成数据的同时,我们采用主动学习方法,将大量真实世界数据(特别是从真实专利和科学文献中裁剪的样本)纳入训练过程。我们使用课程学习方法训练了一个端到端的分子图像描述模型MolParser。在大多数场景下,MolParser显著优于经典方法和基于学习的方法,并具有更广泛下游应用的潜力。该数据集已在huggingface上公开。

关键词

引用

@article{arxiv.2411.11098,
  title  = {MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild},
  author = {Xi Fang and Jiankun Wang and Xiaochen Cai and Shangqian Chen and Shuwen Yang and Haoyi Tao and Nan Wang and Lin Yao and Linfeng Zhang and Guolin Ke},
  journal= {arXiv preprint arXiv:2411.11098},
  year   = {2025}
}