中文

MIT-10M:大规模多语言图像翻译平行语料库

计算机视觉与模式识别 2024-12-17 v2 人工智能

摘要

图像翻译(Image Translation, IT)在多个领域具有巨大潜力,能够将图像中的文本内容翻译成各种语言。然而,现有数据集在规模、多样性和质量方面往往存在局限,阻碍了图像翻译模型的开发和评估。为解决这一问题,我们提出了 MIT-10M,一个包含超过 1000 万图像-文本对的大规模多语言图像翻译平行语料库,数据来源于真实世界,经过广泛的数据清洗和多语言翻译验证。它包含 84 万张图像(三种尺寸)、28 个类别、三个难度级别的任务以及 14 种语言的图像-文本对,相比现有数据集有显著提升。我们在 MIT-10M 上进行了广泛的实验以评估和训练模型。实验结果清楚地表明,我们的数据集在评估模型应对真实世界中具有挑战性和复杂性的图像翻译任务时具有更强的适应性。此外,使用 MIT-10M 微调的模型性能相比基线模型提升了三倍,进一步证实了其优越性。

关键词

引用

@article{arxiv.2412.07147,
  title  = {MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation},
  author = {Bo Li and Shaolin Zhu and Lijie Wen},
  journal= {arXiv preprint arXiv:2412.07147},
  year   = {2024}
}

备注

Accepted in COLING 2025