面向多模态机器翻译的 Gumbel-Attention 机制
计算与语言
2022-07-26 v2
摘要
多模态机器翻译(MMT)通过引入视觉信息来提升翻译质量。然而,现有的 MMT 模型忽略了图像会带来与文本无关的信息这一问题,给模型造成大量噪声并影响翻译质量。本文提出一种新颖的面向多模态机器翻译的 Gumbel-Attention,用于筛选图像特征中与文本相关的部分。具体而言,与以往基于注意力的方法不同,我们首先使用一种可微分的方法来选择图像信息并自动去除图像特征中无用的部分。实验证明,我们的方法保留了与文本相关的图像特征,且保留的部分有助于 MMT 模型生成更好的翻译。
引用
@article{arxiv.2103.08862,
title = {Gumbel-Attention for Multi-modal Machine Translation},
author = {Pengbo Liu and Hailong Cao and Tiejun Zhao},
journal= {arXiv preprint arXiv:2103.08862},
year = {2022}
}