中文

用于视觉问答的调制自注意力卷积网络

计算机视觉与模式识别 2019-11-01 v2 计算与语言 机器学习

摘要

随着面向真实世界视觉推理与组合式问答的新数据集不断涌现,可能有必要在训练期间将视觉特征提取作为端到端过程使用。本简短贡献旨在提出新思路以改进传统卷积网络用于视觉问答(VQA)的视觉处理。在本文中,我们提出用语言输入调制一个增强了自注意力的CNN。我们展示了鼓励未来该方向研究的相对改进。

关键词

引用

@article{arxiv.1910.03343,
  title  = {Modulated Self-attention Convolutional Network for VQA},
  author = {Jean-Benoit Delbrouck and Antoine Maiorca and Nathan Hubens and Stéphane Dupont},
  journal= {arXiv preprint arXiv:1910.03343},
  year   = {2019}
}

备注

Accepted at NeurIPS 2019 workshop: ViGIL