GoG:用于视觉对话的关系感知图上层图网络
计算与语言
2022-06-02 v3 计算机视觉与模式识别
摘要
视觉对话旨在围绕给定图像与人类进行有意义的对话,是一项具有挑战性的任务,要求模型推理视觉内容、对话历史与当前问题之间的复杂依赖关系。图神经网络近期被应用于建模图像中或对话中对象间的隐式关系。然而,它们忽视了以下重要性:1)对话历史间的共指关系及问题中词间的依赖关系对于问题表示的作用;2)基于充分表示的问题的图像表示。因此,我们提出一种新颖的用于视觉对话的关系感知图上层图网络(GoG)。具体而言,GoG 由三个顺序图组成:1)H-Graph,旨在捕获对话历史间的共指关系;2)历史感知 Q-Graph,旨在基于对话历史上的共指消解捕获词间依赖关系,从而充分理解问题;3)问题感知 I-Graph,旨在基于充分的问题表示捕获图像中对象间的关系。作为额外的特征表示模块,我们将 GoG 添加至现有视觉对话模型中。实验结果表明,我们的模型在生成式与判别式设定下均以显著优势超越强基线。
引用
@article{arxiv.2109.08475,
title = {GoG: Relation-aware Graph-over-Graph Network for Visual Dialog},
author = {Feilong Chen and Xiuyi Chen and Fandong Meng and Peng Li and Jie Zhou},
journal= {arXiv preprint arXiv:2109.08475},
year = {2022}
}
备注
ACL Findings 2021. arXiv admin note: text overlap with arXiv:2109.06013