面向目标导向视觉对话的答案驱动视觉状态估计器
计算机视觉与模式识别
2022-03-25 v2
摘要
目标导向视觉对话涉及提问者(Questioner)与回答者(Oracle)两个智能体之间的多轮交互。其中,Oracle 给出的答案具有重要意义,因为它提供了提问者所关注问题的黄金回应。基于答案,提问者更新其对目标视觉内容的信念并进一步提出另一个问题。值得注意的是,不同的答案驱动出不同的视觉信念与未来问题。然而,现有方法总是在长得多的问题之后无差别地编码答案,导致对答案的利用较弱。本文中,我们提出一种答案驱动视觉状态估计器(ADVSE)来施加不同答案对视觉状态的影响。首先,我们提出答案驱动聚焦注意力(ADFA),通过在每一轮锐化问题相关注意力并基于答案的逻辑操作对其调整,来捕捉答案驱动的视觉注意力影响。然后基于聚焦注意力,我们通过条件视觉信息融合(CVIF)获得视觉状态估计,其中整体信息与差异信息以问题-答案状态为条件进行融合。我们在大规模 GuessWhat?! 数据集上将提出的 ADVSE 应用于问题生成器和猜测器任务,并在两项任务上均取得了最先进(state-of-the-art)性能。定性结果表明,ADVSE 促使智能体生成高效问题,并在合理的提问与猜测过程中获得可靠的视觉注意力。
引用
@article{arxiv.2010.00361,
title = {Answer-Driven Visual State Estimator for Goal-Oriented Visual Dialogue},
author = {Zipeng Xu and Fangxiang Feng and Xiaojie Wang and Yushu Yang and Huixing Jiang and Zhongyuan Wang},
journal= {arXiv preprint arXiv:2010.00361},
year = {2022}
}
备注
Accepted at ACM International Conference on Multimedia (ACM MM 2020)