用于视觉问答的调制自注意力卷积网络
计算机视觉与模式识别
2019-11-01 v2 计算与语言
机器学习
摘要
随着面向真实世界视觉推理与组合式问答的新数据集不断涌现,可能有必要在训练期间将视觉特征提取作为端到端过程使用。本简短贡献旨在提出新思路以改进传统卷积网络用于视觉问答(VQA)的视觉处理。在本文中,我们提出用语言输入调制一个增强了自注意力的CNN。我们展示了鼓励未来该方向研究的相对改进。
引用
@article{arxiv.1910.03343,
title = {Modulated Self-attention Convolutional Network for VQA},
author = {Jean-Benoit Delbrouck and Antoine Maiorca and Nathan Hubens and Stéphane Dupont},
journal= {arXiv preprint arXiv:1910.03343},
year = {2019}
}
备注
Accepted at NeurIPS 2019 workshop: ViGIL