CaMMT:文化感知多模态机器翻译基准测试
计算与语言
2025-09-23 v2
摘要
由于文化之间概念化的差异,翻译文化内容对机器翻译系统构成了挑战,仅靠语言可能无法传达足够的上下文来捕捉特定区域的含义。在本工作中,我们研究在多模态翻译中图像是否可以作为文化上下文。我们引入了 CaMMT,这是一个由人工策划的基准测试,包含超过 5,800 个三元组,包含图像以及英语和区域语言的平行字幕。使用该数据集,我们在纯文本和文本+图像设置下评估了五个视觉语言模型。通过自动和人工评估,我们发现视觉上下文通常能提高翻译质量,特别是在处理文化特定项、消除歧义和正确的性别标记方面。通过发布 CaMMT,我们的目标是支持更广泛的努力,以构建和评估更好地与文化细微差别和区域差异对齐的多模态翻译系统。
引用
@article{arxiv.2505.24456,
title = {CaMMT: Benchmarking Culturally Aware Multimodal Machine Translation},
author = {Emilio Villa-Cueva and Sholpan Bolatzhanova and Diana Turmakhan and Kareem Elzeky and Henok Biadglign Ademtew and Alham Fikri Aji and Vladimir Araujo and Israel Abebe Azime and Jinheon Baek and Frederico Belcavello and Fermin Cristobal and Jan Christian Blaise Cruz and Mary Dabre and Raj Dabre and Toqeer Ehsan and Naome A Etori and Fauzan Farooqui and Jiahui Geng and Guido Ivetta and Thanmay Jayakumar and Soyeong Jeong and Zheng Wei Lim and Aishik Mandal and Sofia Martinelli and Mihail Minkov Mihaylov and Daniil Orel and Aniket Pramanick and Sukannya Purkayastha and Israfel Salazar and Haiyue Song and Tiago Timponi Torrent and Debela Desalegn Yadeta and Injy Hamed and Atnafu Lambebo Tonja and Thamar Solorio},
journal= {arXiv preprint arXiv:2505.24456},
year = {2025}
}