微调 DeepSeek-OCR-2 用于分子结构识别
计算机视觉与模式识别
2026-04-22 v2 人工智能
生物大分子
摘要
光学化学结构识别(OCSR)对于将印刷文献中的二维分子图转换为机器可读格式至关重要。虽然视觉-语言模型在端到端 OCR 任务中展现出潜力,但其直接应用于 OCSR 仍具挑战性,且直接的全参数监督微调常常失败。在这项工作中,我们通过将任务形式化为图像条件的 SMILES 生成,使 DeepSeek-OCR-2 适应分子光学识别。为克服训练不稳定性,我们提出了一种两阶段渐进式监督微调策略:从参数高效的 LoRA 开始,过渡到具有分离学习率的选择性全参数微调。我们在一个大规模语料库上训练模型,该语料库结合了来自 PubChem 的合成渲染图像和来自 USPTO-MOL 的真实专利图像,以提高覆盖范围和鲁棒性。我们微调后的模型 MolSeek-OCR 展示了具有竞争力的能力,其精确匹配准确率可与性能最佳的图像到序列模型相媲美。然而,它仍不及最先进的图像到图模型。此外,我们探索了强化式后训练和基于数据管理的优化,发现它们未能提高精确 SMILES 匹配所需的严格序列级保真度。
引用
@article{arxiv.2604.03476,
title = {Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition},
author = {Haocheng Tang and Xingyu Dang and Junmei Wang},
journal= {arXiv preprint arXiv:2604.03476},
year = {2026}
}