面向多模态翻译的潜变量模型
计算与语言
2019-05-17 v2
摘要
在这项工作中,我们提出通过潜变量模型来建模多模态神经机器翻译(MMT)中视觉特征与文本特征之间的交互。该潜变量可视为一幅图像及其外语描述的多模态随机嵌入。它被用于目标语言解码器,并用于预测图像特征。重要的是,我们的模型公式在训练时利用视觉与文本输入,但在测试时不需要图像可用。我们表明,我们的潜变量MMT公式相比强基线有显著提升,包括多任务学习方法(Elliott and Kádár, 2017)和条件变分自编码器方法(Toyama et al., 2016)。最后,我们展示了以下改进来源:(i)除仅以图像特征为条件外还预测图像特征,(ii)对潜变量中编码的最小信息量施加约束,以及(iii)通过在额外的目标语言图像描述(即合成数据)上训练。
引用
@article{arxiv.1811.00357,
title = {Latent Variable Model for Multi-modal Translation},
author = {Iacer Calixto and Miguel Rios and Wilker Aziz},
journal= {arXiv preprint arXiv:1811.00357},
year = {2019}
}
备注
Paper accepted at ACL 2019. Contains 8 pages (11 including references, 13 including appendix), 6 figures