基于多模态乘性特征嵌入的共注意力自由形式区域与检测框的视觉问答方法
计算机视觉与模式识别
2018-03-02 v2 人工智能
计算与语言
摘要
近来,视觉问答(VQA)任务在人工智能领域受到越来越多的关注。现有 VQA 方法主要采用视觉注意力机制,将输入问题与相应的图像区域关联以实现有效的问答。基于自由形式区域与基于检测框的视觉注意力机制已被大量研究,前者关注自由形式的图像区域,后者关注预先指定的检测框区域。我们认为这两种注意力机制能够提供互补信息,并应被有效整合以更好地解决 VQA 问题。本文提出一种用于 VQA 的新型深度神经网络,整合了上述两种注意力机制。我们提出的框架通过多模态乘性特征嵌入方案,有效融合来自自由形式图像区域、检测框以及问题表示的特性,联合关注与问题相关的自由形式图像区域与检测框,以实现更准确的问答。所提方法在两个公开数据集 COCO-QA 和 VQA 上进行了充分评估,并优于当前最优方法。源代码见 https://github.com/lupantech/dual-mfa-vqa。
引用
@article{arxiv.1711.06794,
title = {Co-attending Free-form Regions and Detections with Multi-modal Multiplicative Feature Embedding for Visual Question Answering},
author = {Pan Lu and Hongsheng Li and Wei Zhang and Jianyong Wang and Xiaogang Wang},
journal= {arXiv preprint arXiv:1711.06794},
year = {2018}
}
备注
To appear in AAAI 2018