中文

视觉问答中问题类型引导的注意力

计算机视觉与模式识别 2018-07-20 v2

摘要

视觉问答(VQA)需要整合具有截然不同结构的特征图并聚焦于正确区域。图像描述符在多个空间尺度上具有结构,而词法输入固有地遵循时间序列并自然聚为语义不同的问题类型。许多先前工作使用复杂模型提取特征表示,却忽视在利用如问题类型等高级信息摘要进行学习。本工作中,我们提出问题类型引导注意力(QTA)。它利用问题类型信息动态平衡分别由 ResNet 与 Faster R-CNN 网络提取的自底向上与自顶向下视觉特征。我们在多种 VQA 架构上结合对 TDIUC 数据集的广泛输入消融研究进行实验,表明 QTA 在 TDIUC 数据集上跨多个问题类型类别(如“活动识别”、“效用”与“计数”)系统性地提升性能超过 5%。通过在最优模型 MCB 上添加 QTA,我们实现了整体精度 3% 的提升。最后,我们提出一种预测问题类型的多任务扩展,将 QTA 推广至缺乏问题类型的应用,且性能损失最小。

关键词

引用

@article{arxiv.1804.02088,
  title  = {Question Type Guided Attention in Visual Question Answering},
  author = {Yang Shi and Tommaso Furlanello and Sheng Zha and Animashree Anandkumar},
  journal= {arXiv preprint arXiv:1804.02088},
  year   = {2018}
}