一图值千句(正确)译文:基于视觉引导的多模态机器翻译评判-纠错系统
计算与语言
2025-11-11 v1 计算机视觉与模式识别
人机交互
摘要
本文描述了我们团队 BLEU Monday 在 2025 年 WAT 英-印度语言多模态翻译任务中的系统。我们参与了英-印地语、英-孟加拉语、英-马拉拉姆语和英-奥利亚语语言对的文本-only 翻译任务。我们提出了两个阶段的方法,通过自动化错误检测和纠正来解决训练数据中的质量问题,随后采用参数高效的模型微调。我们的 метод论引入了视觉增强的评判-纠错管道,利用多模态语言模型系统性地识别和纠正训练数据中的翻译错误。评判组件将翻译分为三类:正确、视觉模糊(需要图像上下文)或翻译错误(翻译质量差)。识别出的错误被路由到专门的纠错器:GPT-4o-mini 重新生成需要视觉消歧的标题,而 IndicTrans2 对纯翻译质量问题的情况进行重译。该自动化管道处理了四种语言的 28,928 条训练示例,平均纠正了每种语言约 17.1% 的标题。随后我们对 IndicTrans2 en-indic 200M 蒸馏模型应用低秩适应(LoRA)进行微调,在原始和已纠正的数据集上进行训练。使用纠正后的数据训练可获得持续的性能提升,英-孟加拉语在评估集上的 BLEU 分数提升 +1.30(42.00 → 43.30),挑战集提升 +0.70(44.90 → 45.60),英-奥利亚语在评估集提升 +0.60(41.00 → 41.60),英-印地语在挑战集提升 +0.10(53.90 → 54.00)。
引用
@article{arxiv.2511.07010,
title = {A Picture is Worth a Thousand (Correct) Captions: A Vision-Guided Judge-Corrector System for Multimodal Machine Translation},
author = {Siddharth Betala and Kushan Raj and Vipul Betala and Rohan Saswade},
journal= {arXiv preprint arXiv:2511.07010},
year = {2025}
}
备注
Accepted at The 12th Workshop on Asian Translation, co-located with IJCLNLP-AACL 2025