中文

面向视觉对话强化学习的显式关注状态建模

计算机视觉与模式识别 2021-11-29 v2

摘要

为促使 AI 智能体开展有意义的视觉对话(VD),强化学习的应用已被证明具有潜力。在强化学习中,基于动作引起的状态转移来表示状态并分配奖励至关重要。然而,以往视觉对话工作的状态表示仅使用文本信息,且其转移是隐式的。本文提出显式关注状态(ECS)来表示每一轮所关注的视觉内容以及整个视觉对话过程中已被关注的内容。ECS 由多模态信息建模,并显式表示。基于 ECS,我们制定了两个直观且可解释的奖励,以鼓励视觉对话智能体就多样且信息丰富的视觉信息进行对话。在 VisDial v1.0 数据集上的实验结果表明,根据多项自动指标、人工研究和定性分析,与以往方法相比,我们的方法使视觉对话智能体生成更具视觉连贯性、更少重复且更具视觉信息量的对话。

关键词

引用

@article{arxiv.2107.05250,
  title  = {Modeling Explicit Concerning States for Reinforcement Learning in Visual Dialogue},
  author = {Zipeng Xu and Fandong Meng and Xiaojie Wang and Duo Zheng and Chenxu Lv and Jie Zhou},
  journal= {arXiv preprint arXiv:2107.05250},
  year   = {2021}
}

备注

In BMVC 2021