中文

高效的对象级视觉上下文建模用于多模态机器翻译:掩蔽无关对象有助于 grounding

计算机视觉与模式识别 2021-01-14 v1 人工智能 计算与语言

摘要

视觉上下文为多模态机器翻译(MMT)提供grounding信息。然而,以往的MMT模型及对视觉特征的探测研究表明,视觉信息在MMT中较少被利用,因为它常与文本信息冗余。本文提出一种对象级视觉上下文建模框架(OVC),以高效捕获并利用视觉信息用于多模态机器翻译。借助检测到的对象,所提OVC通过掩蔽视觉模态中无关对象,鼓励MMT将翻译grounding于期望的视觉对象上。我们为该框架配备额外的对象掩蔽损失以实现此目标。对象掩蔽损失根据被掩蔽对象与源文本的相似度来估计,从而鼓励掩蔽与源文本无关的对象。此外,为生成视觉一致的目标词,我们进一步为OVC提出视觉加权翻译损失。在MMT数据集上的实验表明,所提OVC模型优于最先进的MMT模型,且分析显示掩蔽无关对象有助于MMT中的grounding。

关键词

引用

@article{arxiv.2101.05208,
  title  = {Efficient Object-Level Visual Context Modeling for Multimodal Machine Translation: Masking Irrelevant Objects Helps Grounding},
  author = {Dexin Wang and Deyi Xiong},
  journal= {arXiv preprint arXiv:2101.05208},
  year   = {2021}
}