一种用于多模态机器翻译的视觉注意力 grounding 神经模型
计算与语言
2018-08-29 v2
摘要
我们提出了一种利用并行视觉与文本信息的新型多模态机器翻译模型。我们的模型联合优化共享视觉-语言嵌入与翻译器的学习。该模型利用一种将视觉语义与相应文本语义关联的视觉注意力 grounding 机制。我们的方法在 Multi30K 与 Ambiguous COCO 数据集上取得了有竞争力的 SOTA 结果。我们还收集了一个新的多语言多模态产品描述数据集,以模拟真实世界的国际在线购物场景。在该数据集上,我们的视觉注意力 grounding 模型大幅优于其他方法。
引用
@article{arxiv.1808.08266,
title = {A Visual Attention Grounding Neural Model for Multimodal Machine Translation},
author = {Mingyang Zhou and Runxiang Cheng and Yong Jae Lee and Zhou Yu},
journal= {arXiv preprint arXiv:1808.08266},
year = {2018}
}