中文

VALHALLA:用于机器翻译的视觉幻觉

计算机视觉与模式识别 2022-06-02 v1 计算与语言

摘要

近年来,通过考虑图像等辅助输入来设计更好的机器翻译系统引起了广泛关注。虽然现有方法相比传统纯文本翻译系统展现出有前景的性能,但它们通常在推理时需要成对的文本和图像作为输入,这限制了其在真实场景中的适用性。在本文中,我们引入了一种称为VALHALLA的视觉幻觉框架,该框架在推理时仅需源句子,而是使用幻觉视觉表示进行多模态机器翻译。具体而言,给定源句子,使用自回归幻觉变换器从输入文本预测离散视觉表示,并将文本与幻觉表示结合以获得目标翻译。我们使用带交叉熵损失的标准反向传播与幻觉变换器联合训练翻译变换器,同时由额外的损失引导,该损失鼓励使用真实或幻觉视觉表示的预测之间的一致性。在三个标准翻译数据集上以多种语言对进行的广泛实验证明了我们的方法相对于纯文本基线和最先进方法的有效性。项目页面:http://www.svcl.ucsd.edu/projects/valhalla。

关键词

引用

@article{arxiv.2206.00100,
  title  = {VALHALLA: Visual Hallucination for Machine Translation},
  author = {Yi Li and Rameswar Panda and Yoon Kim and Chun-Fu Chen and Rogerio Feris and David Cox and Nuno Vasconcelos},
  journal= {arXiv preprint arXiv:2206.00100},
  year   = {2022}
}

备注

CVPR 2022