中文

图像含文字机器翻译系统比较评估

计算与语言 2026-05-29 v1

摘要

本工作对机器翻译系统应用于包含文本信息的图像进行比较评估,这一任务位于计算机视觉与自然语言处理的交叉领域。研究比较了三大主流范式:模块化管线分离文本检测、识别与翻译;多模态大语言模型(MLLM)能够联合处理图像和文本;以及一种端到端模型Translatotron-V,直接生成翻译后的图像。模块化系统采用最先进的OCR(docTR)结合多语言LLM如Llama和EuroLLM,评估的MLLM包括不同配置的Gemini 2.5。实验在覆盖多语言对的平行多语言数据集上进行,采用BLEU、chrF和TER指标评估。结果表明,模块化管线超过端到端方法,而MLLM实现最佳整体性能,展现出卓越的灵活性与上下文理解能力。这些发现凸显了多模态推理在图像到文本翻译中的有效性,为未来在多语言环境中集成视觉理解与语言生成提供坚实基础。

关键词

引用

@article{arxiv.2605.29476,
  title  = {Comparative Evaluation of Machine Translation Systems on Images with Text},
  author = {Blai Puchol and Sergio Gómez González and Miguel Domingo and Francisco Casacuberta},
  journal= {arXiv preprint arXiv:2605.29476},
  year   = {2026}
}