因子图注意力
计算机视觉与模式识别
2020-03-10 v3 人工智能
计算与语言
信息检索
机器学习
摘要
对话是交换信息的有效方式,但微妙的细节和细微差别极为重要。尽管重大进展为用算法解决视觉对话铺平了道路,但细节和细微差别仍然是一个挑战。注意力机制在视觉问答中展示了提取细节的令人信服的结果,并且由于其可解释性和有效性,也为视觉对话提供了令人信服的框架。然而,视觉对话伴随的许多数据效用挑战了现有的注意力技术。我们解决了这个问题,并开发了一种适用于视觉对话的通用注意力机制,该机制可作用于任意数量的数据效用。为此,我们设计了一种基于因子图的注意力机制,它结合了任意数量的效用表示。我们在具有挑战性且近期引入的 VisDial 数据集上展示了所提出方法的适用性,在 MRR 上,VisDial0.9 超越了近期 SOTA 方法 1.1%,VisDial1.0 超越了 2%。我们的集成模型在 VisDial1.0 上的 MRR 分数提高了 6% 以上。
引用
@article{arxiv.1904.05880,
title = {Factor Graph Attention},
author = {Idan Schwartz and Seunghak Yu and Tamir Hazan and Alexander Schwing},
journal= {arXiv preprint arXiv:1904.05880},
year = {2020}
}
备注
Accepted to CVPR 2019; revised version includes bottom-up features