出于误解的原因而有效:多模态机器翻译中对视觉上下文需求的经验重访
计算与语言
2021-06-01 v1 人工智能
摘要
神经多模态机器翻译(MMT)系统旨在通过用多模态信息扩展传统的仅文本翻译模型来实现更好的翻译。许多近期研究报道,在模型中加入多模态模块后取得了改进,尽管对于这些改进是否确实来自多模态部分存在争议。我们通过设计两个可解释的 MMT 模型,重访多模态信息在 MMT 中的贡献。令人惊讶的是,尽管我们的模型复现了近期发展的多模态集成系统所达到的类似增益,但它们学会忽略多模态信息。进一步调研后,我们发现多模态模型相对仅文本对照模型所取得的改进,事实上是正则化效应的结果。我们报告的经验发现凸显了 MMT 模型可解释性的重要性,并讨论了我们的发现将如何裨益未来研究。
引用
@article{arxiv.2105.14462,
title = {Good for Misconceived Reasons: An Empirical Revisiting on the Need for Visual Context in Multimodal Machine Translation},
author = {Zhiyong Wu and Lingpeng Kong and Wei Bi and Xiang Li and Ben Kao},
journal= {arXiv preprint arXiv:2105.14462},
year = {2021}
}
备注
To appear at ACL 2021 main conference