中文

基于多模态大语言模型的单模态到混合模态对齐用于文档图像机器翻译

计算与语言 2025-07-11 v1 人工智能 计算机视觉与模式识别

摘要

文档图像机器翻译(DIMT, Document Image Machine Translation)旨在翻译文档图像中的文本,由于训练数据有限以及视觉与文本信息之间复杂相互作用,面临泛化性挑战。为此,我们提出了M4Doc框架——一种基于多模态大语言模型(MLLM, Multimodal Large Language Model)的单模态到混合模态对齐框架。M4Doc将仅依赖图像的编码器与MLLM的多模态表征进行对齐,该编码器在大规模文档图像数据集上进行预训练。这种对齐使轻量级DIMT模型在训练期间能够学习关键的视觉-文本相关性。推理阶段,M4Doc可绕过MLLM,保持计算效率,同时受益于其多模态知识。全面实验表明,该方法在翻译质量上实现了显著提升,尤其在跨域泛化和挑战性文档图像场景中表现尤为突出。

关键词

引用

@article{arxiv.2507.07572,
  title  = {Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation},
  author = {Yupu Liang and Yaping Zhang and Zhiyang Zhang and Yang Zhao and Lu Xiang and Chengqing Zong and Yu Zhou},
  journal= {arXiv preprint arXiv:2507.07572},
  year   = {2025}
}

备注

Accepted by ACL 2025 Main