面向大规模化学反应图像解析的多模态大语言模型
计算机视觉与模式识别
2025-03-12 v1 机器学习
摘要
人工智能(AI)在推动有机化学研究方面展现出巨大潜力,但其效能取决于高质量化学反应数据的可用性。目前,大多数已发表的化学反应无法以机器可读格式提供,限制了该领域AI的更广泛应用。从化学反应图像中提取结构化数据库仍高度依赖人工策划,鲁棒的自动解析化学反应图像以机器可读数据形式呈现仍是重大挑战。为此,我们引入了反应图像多模态大语言模型(Reaction Image Multimodal large language model,RxnIM),这是第一个专为解析化学反应图像到机器可读反应数据而设计的多模态大语言模型。RxnIM不仅从反应图像中提取关键化学组成部分,还解释描述反应条件的文本内容。配合专为模型训练设计的大规模数据集生成方法,我们的方法在各种基准测试中取得优异表现,平均F1分数达到88%,超越文献方法5个百分点。这标志着自动构建从化学文献图像解析的大规模机器可读反应数据数据库的关键一步,为化学领域的AI研究提供了重要数据资源。本工作开发的源代码、模型检查点和数据集均采用宽松许可证发布。RxnIM网页应用可在 https://huggingface.co/spaces/CYF200127/RxnIM 访问。
引用
@article{arxiv.2503.08156,
title = {Towards Large-scale Chemical Reaction Image Parsing via a Multimodal Large Language Model},
author = {Yufan Chen and Ching Ting Leung and Jianwei Sun and Yong Huang and Linyan Li and Hao Chen and Hanyu Gao},
journal= {arXiv preprint arXiv:2503.08156},
year = {2025}
}