中文

让历史发挥作用:面向视觉对话的历史优势序列训练

计算机视觉与模式识别 2019-04-18 v3

摘要

我们研究视觉对话中的多轮响应生成,其中响应根据视觉基础的对话历史生成。给定三元组:图像、问答历史和当前问题,所有主流方法都遵循监督学习范式中的编解码(即编码器-解码器)模式:多模态编码器将三元组编码为特征向量,随后送入解码器生成当前答案,并由真值监督。然而,这种常规监督学习未考虑不完美历史的影响,违背了视觉对话的对话本质,从而使编解码器更倾向于学习历史偏差而非上下文推理。为此,受强化学习中 actor-critic 策略梯度的启发,我们提出一种称为历史优势序列训练(HAST)的新颖训练范式。具体而言,我们有意在历史中植入错误答案,获得一个反向评论家,并通过历史优势——由真值历史黄金奖励减去反向评论家所得的量——观察历史错误如何影响编解码器的未来行为。此外,为使编解码器对历史更敏感,我们提出一种称为历史感知协同注意力网络(HACAN)的新型注意力网络,其可通过 HAST 有效训练。在三个基准:VisDial v0.9&v1.0 和 GuessWhat?! 上的实验结果表明,所提出的 HAST 策略一致优于最先进的监督对应方法。

关键词

引用

@article{arxiv.1902.09326,
  title  = {Making History Matter: History-Advantage Sequence Training for Visual Dialog},
  author = {Tianhao Yang and Zheng-Jun Zha and Hanwang Zhang},
  journal= {arXiv preprint arXiv:1902.09326},
  year   = {2019}
}