IMTBench:面向图像内机器翻译的多情景跨模态协作评估基准
计算机视觉与模式识别
2026-04-02 v2
摘要
端到端图像内机器翻译(IIMT)旨在将嵌入图像中的文本转换为目标语言,同时保持原始视觉上下文、布局和渲染风格。然而,现有 IIMT 基准大多为合成数据,无法反映真实世界的复杂性,而当前的评估协议仅关注单模态指标,忽略渲染文本与模型输出之间跨模态的忠实性。为此,我们提出了图像内机器翻译基准(IMTBench),一个覆盖四个实际情景和九种语言的 2,500 条图像翻译样本的新基准。IMTBench 支持多方面评估,包括翻译质量、背景保持、整体图像质量以及衡量模型输出翻译文本与翻译后图像中渲染文本一致性的跨模态对齐分数。我们对强大的商业级级联系统、封闭式和开放式统一多模态模型进行了基准测试,发现不同情景和语言之间存在显著性能差距,尤其是在自然场景和资源受限语言上,显示出巨大的性能提升空间。我们希望 IMTBench 建立标准化基准,加速这一新兴任务的进展。
引用
@article{arxiv.2603.10495,
title = {IMTBench: A Multi-Scenario Cross-Modal Collaborative Evaluation Benchmark for In-Image Machine Translation},
author = {Jiahao Lyu and Pei Fu and Zhenhang Li and Weichao Zeng and Shaojie Zhang and Jiahui Yang and Can Ma and Yu Zhou and Zhenbo Luo and Jian Luan},
journal= {arXiv preprint arXiv:2603.10495},
year = {2026}
}