中文

面向视觉问答的紧凑张量池化

计算机视觉与模式识别 2017-06-22 v1

摘要

执行高级认知任务需要整合结构差异巨大的特征图。在视觉问答(VQA)中,图像描述符具有空间结构,而词法输入固有地遵循时间序列。最近提出的多模态紧凑双线性池化(Multimodal Compact Bilinear pooling, MCB)通过计数草图(count-sketch)近似,在每个空间位置形成视觉与文本表示的外部乘积。尽管该过程在局部保留了空间信息,但外部乘积是针对激活张量的每个纤维独立进行的,因此未包含空间上下文。在本文中,我们引入多维草图(MD-sketch),即计数草图向张量的新颖扩展。利用这一新公式,我们提出多模态紧凑张量池化(Multimodal Compact Tensor Pooling, MCT),以在双线性池化操作中充分利用全局空间上下文。与MCB相反,我们的方法通过使用高阶FFT将视觉张量特征的MD-sketch与文本向量特征直接卷积,从而保留空间上下文。此外,我们在问题嵌入的每一步增量地应用MCT,并在选择最终答案之前通过第二个LSTM层累积多模态向量。

关键词

引用

@article{arxiv.1706.06706,
  title  = {Compact Tensor Pooling for Visual Question Answering},
  author = {Yang Shi and Tommaso Furlanello and Anima Anandkumar},
  journal= {arXiv preprint arXiv:1706.06706},
  year   = {2017}
}