面向多语言 OCR 的细调与提示引导的链式思考推理
计算机视觉与模式识别
2026-05-26 v2 计算与语言
机器学习
摘要
光学字符识别(OCR)和多语言文本理解是多模态大语言模型(MLLM)的主要失效模式,尤其在包含杂乱布局、小字体、模糊、遮挡和复杂排版的真实图像中更为突出。我们提出了一种 OCR 感知的多语言多模态训练框架,组合(i)大规模合成 OCR-翻译数据生成、(ii)基于 LoRA 的 OCR 感知监督微调(SFT)以及(iii)结构化视觉链式思考(CoT)提示,用于在不确定视觉条件下的推理。采用基于 LLaMA 的多模态架构,本框架在 OCR 完整性、多语言翻译准确性和对退化视觉条件的鲁棒性方面均显著提升。在多语言发票、菜单、海报、标志、手写文字及文档图像上进行实验,结果表明与基线模型相比在视觉-文本 grounding 方面显著优于基线模型。特别地,所提出的 OCR 感知后训练框架在提取小尺寸、模糊、零散且部分遮挡文本方面取得显著改善,同时在不确定 OCR 条件下降低对语言先验的依赖。定性比较包括 GPT-5 级别及 Gemini 系列模型,进一步表明在噪声和视觉模糊的 OCR 场景下实现了更好的 OCR grounding 与减少幻觉。总体而言,结果表明数据中心的 OCR 感知式多模态后训练为改进多语言 OCR 与 OCR 驱动的视觉问答系统提供了有效且可扩展的方向。
引用
@article{arxiv.2605.16409,
title = {Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models},
author = {Qinwu Xu and Yifan Jiang and Haoyu Ren},
journal= {arXiv preprint arXiv:2605.16409},
year = {2026}
}