ORD:面向视觉对话生成的目标关系发现方法
计算机视觉与模式识别
2020-06-16 v1 多媒体
摘要
随着单轮图像描述与视觉问答的快速发展,如何生成关于视觉内容的多轮对话尚未得到充分探索。现有视觉对话方法将图像直接编码为固定特征向量,并与问题和历史嵌入拼接以预测回复。一些近期方法利用协同注意力机制解决共指消解问题,交叉引用图像、历史和目标问题中的相关元素。然而,由于细粒度目标级信息在协同注意力推理前被忽略,推理视觉关系仍具挑战性。本文提出一种目标关系发现(ORD)框架,以保留目标交互用于视觉对话生成。具体而言,提出一种层次图卷积网络(HierGCN)在局部保留目标节点与邻域关系,并在全局细化目标-目标连接以获得最终图嵌入。进一步引入图注意力,在回复推理阶段动态关注该图结构表示。大量实验证明,所提方法通过利用视觉关系的上下文信息可显著提升对话质量。该模型在 Visual Dialog 数据集上优于最先进方法,将 MRR 从 0.6222 提升至 0.6447,recall@1 从 48.48% 提升至 51.22%。
引用
@article{arxiv.2006.08322,
title = {ORD: Object Relationship Discovery for Visual Dialogue Generation},
author = {Ziwei Wang and Zi Huang and Yadan Luo and Huimin Lu},
journal= {arXiv preprint arXiv:2006.08322},
year = {2020}
}