视觉应在其时方有意义:多模态机器翻译模型的合理性检验
计算与语言
2021-09-09 v1
摘要
多模态机器翻译(MMT)系统已被证明在具备视觉语境时优于纯文本的神经机器翻译(NMT)系统。然而,近期研究也表明,当关联图像被无关图像或噪声替换时,MMT 模型的性能仅受到微小影响,这暗示模型可能根本未利用视觉语境。我们假设这可能是由于常用评估基准(即 Multi30K)的性质所致,其中图像描述文本的翻译是在未向人工译员展示图像的情况下准备的。本文中,我们呈现了一项定性研究,考察数据集在促使利用视觉模态方面的作用,并提出了凸显数据集中视觉信号重要性的方法,证明了模型对源图像的依赖有所改善。我们的发现表明,当前关于高效 MMT 架构的研究受限于缺乏合适的数据集,未来 MMT 数据集的构建须审慎考量,我们也为此提供了有益的见解。
引用
@article{arxiv.2109.03415,
title = {Vision Matters When It Should: Sanity Checking Multimodal Machine Translation Models},
author = {Jiaoda Li and Duygu Ataman and Rico Sennrich},
journal= {arXiv preprint arXiv:2109.03415},
year = {2021}
}
备注
EMNLP 2021