中文

MT$^{3}$:基于多任务强化学习扩展多模态大语言模型的文本图像机器翻译

计算与语言 2025-05-27 v1 人工智能 机器学习

摘要

文本图像机器翻译(TIMT)——即翻译嵌入在图像中的文本内容的任务——对于无障碍应用、跨语言信息访问以及真实世界文档理解至关重要。然而,由于需要准确的光学字符识别(OCR)、鲁棒的视觉-文本推理以及高质量的翻译,TIMT 仍然是一项复杂的挑战,通常需要级联的多阶段流程。大规模强化学习(RL)的最新进展提升了大型语言模型(LLM)与多模态大语言模型(MLLM)的推理能力,但其在端到端 TIMT 中的应用仍待深入探索。为了填补这一空白,我们引入了 MT3^{3},这是首个将多任务强化学习应用于 MLLM 以实现端到端 TIMT 的框架。MT3^{3} 采用多任务优化范式,针对三个关键子技能:文本识别、上下文感知推理与翻译。它使用一种新颖的多混合奖励机制进行训练,该机制将基于规则的强化学习策略适配至 TIMT 的复杂性,在各个任务中提供细粒度、非二元的反馈。此外,为了便于在真实的跨文化与真实世界社交媒体语境下评估 TIMT,我们引入了 XHSPost,这是首个社交媒体 TIMT 基准测试。我们的 MT3^{3}-7B-Zero 在最新的领域内 MIT-10M 基准测试上取得了当前最优结果,在多项指标上以显著优势超越了 Qwen2.5-VL-72B 和 InternVL2.5-78B 等强基线。此外,该模型对分布外语言对与数据集展现出强大的泛化能力。深入分析揭示了多任务协同、强化学习初始化、课程设计与奖励构建如何推动 MLLM 驱动的 TIMT 的发展。

关键词

引用

@article{arxiv.2505.19714,
  title  = {MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning},
  author = {Zhaopeng Feng and Yupu Liang and Shaosheng Cao and Jiayuan Su and Jiahan Ren and Zhe Xu and Yao Hu and Wenxuan Huang and Jian Wu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2505.19714},
  year   = {2025}
}

备注

Work in progress