中文

MolNexTR:一种用于分子图像识别的通用深度学习模型

计算机视觉与模式识别 2025-03-12 v3 人工智能

摘要

在化学结构识别领域,将分子图像转换为 SMILES 字符串等机器可读数据格式的任务是一项重大挑战,这主要是由于化学文献中普遍存在的多样化绘图风格和惯例所致。为了弥合这一差距,我们提出了 MolNexTR,这是一种新颖的图像到图深度学习模型,它协同融合了强大的卷积神经网络变体 ConvNext 与 Vision-TRansformer 的优势。这种集成促进了对分子图像局部和全局特征更细致的提取。MolNexTR 能够同时预测原子和键并理解其布局规则,还擅长灵活整合符号化学原理以识别手性并解读缩写结构。我们进一步引入了一系列先进算法,包括改进的数据增强模块、图像污染模块以及用于获取最终 SMILES 输出的后处理模块。这些模块协同工作,增强了模型对真实文献中多样化分子图像风格的鲁棒性。在我们的测试集上,MolNexTR 展现了卓越的性能,准确率达到了 81-97%,标志着分子结构识别领域的重大进步。

关键词

引用

@article{arxiv.2403.03691,
  title  = {MolNexTR: A Generalized Deep Learning Model for Molecular Image Recognition},
  author = {Yufan Chen and Ching Ting Leung and Yong Huang and Jianwei Sun and Hao Chen and Hanyu Gao},
  journal= {arXiv preprint arXiv:2403.03691},
  year   = {2025}
}