中文

为我找理由?基于胶囊网络的弱监督接地视觉问答

计算机视觉与模式识别 2021-05-12 v1

摘要

近年来,VQA 任务的接地问题在研究界受到越来越多的关注,大多数尝试通常聚焦于通过使用预训练目标检测器来解决该任务。然而,预训练目标检测器需要边界框标注以检测词汇表中的相关对象,这对于现实大规模应用未必总是可行。在本文中,我们关注一种更宽松的设定:仅通过在 VQA 任务上训练以弱监督方式接地相关视觉实体。为解决该问题,我们提出一种具有基于查询的胶囊特征选择机制的视觉胶囊模块,使模型能基于问题中关于视觉信息的文本线索聚焦于相关区域。我们展示将所提胶囊模块集成到现有 VQA 系统中可显著提升其在弱监督接地任务上的性能。总体而言,我们在两个最先进 VQA 系统 stacked NMN 和 MAC 上,在 CLEVR-Answers 基准(我们基于 CLEVR 场景建立、带有与正确答案相关对象真值边界框的新评估集)以及 GQA(一个具有组合式问题的真实世界 VQA 数据集)上证明了我们方法的有效性。我们展示带有所提胶囊模块的系统在答案接地方面一致优于相应基线系统,同时在 VQA 任务上取得可比性能。

关键词

引用

@article{arxiv.2105.04836,
  title  = {Found a Reason for me? Weakly-supervised Grounded Visual Question Answering using Capsules},
  author = {Aisha Urooj Khan and Hilde Kuehne and Kevin Duarte and Chuang Gan and Niels Lobo and Mubarak Shah},
  journal= {arXiv preprint arXiv:2105.04836},
  year   = {2021}
}

备注

IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2021