中文

利用预训练视觉-语言表征学习更优视觉对话智能体

计算机视觉与模式识别 2021-05-26 v1

摘要

GuessWhat?!是一个双人视觉对话猜测游戏,玩家A提出一系列是非问题(提问者)并基于玩家B(回答者)的回答对图像中的目标物体做出最终猜测(猜测者)。基于提问者与回答者之间的对话历史,猜测者对目标物体做出最终猜测。此前的基线回答者模型在模型中不编码任何视觉信息,因而无法充分理解关于颜色、形状、关系等的复杂问题。现有多数猜测者工作将对话历史整体编码,并在GuessWhat?!数据集上从零训练猜测者模型。这是有问题的,因为语言编码器倾向于遗忘长期历史,且GuessWhat?!数据在学习物体的视觉接地方面较为稀疏。此前的提问者工作将状态跟踪机制引入模型,但它是作为软中间体学习的,没有任何先验的视觉-语言洞察。为弥补这些差距,本文提出基于Vilbert的回答者、猜测者和提问者,它们都构建于预训练视觉-语言模型Vilbert之上。我们将双向背景/目标融合机制引入Vilbert-回答者,以兼顾物内与物间问题。我们为Vilbert-猜测者和Vilbert-提问者提出统一框架,其中引入状态估计器以最佳利用Vilbert在单轮指代表达理解上的能力。实验结果表明,我们提出的模型在回答者、猜测者和端到端提问者上分别显著超越最先进模型7%、10%、12%。

关键词

引用

@article{arxiv.2105.11541,
  title  = {Learning Better Visual Dialog Agents with Pretrained Visual-Linguistic Representation},
  author = {Tao Tu and Qing Ping and Govind Thattai and Gokhan Tur and Prem Natarajan},
  journal= {arXiv preprint arXiv:2105.11541},
  year   = {2021}
}