中文

通过自举硬注意力学习视觉问答

计算机视觉与模式识别 2018-08-02 v1 人工智能 计算与语言 机器学习 神经与进化计算

摘要

生物感知中的注意力机制被认为会选择部分感知信息进行更复杂的处理,而对所有感官输入进行处理则难以承受。然而,在计算机视觉中,尽管软注意力(信息被重新加权并聚合但从不滤除)取得成功,对硬注意力(选择性忽略某些信息)的探索仍相对较少。在此,我们引入一种硬注意力的新方法,并发现其在近期发布的视觉问答数据集上取得了极具竞争力的性能,在完全忽略某些特征的同时,持平甚至在部分情况下超越类似的软注意力架构。尽管硬注意力机制被认为不可微分,我们发现特征幅值与时义相关性相关,并为我们机制的注意力选择准则提供了有用信号。由于硬注意力选择输入信息的重要特征,它也比类似的软注意力机制更高效。这对于近期使用非局部成对操作的方法尤为重要,因为此类方法的算力和内存开销随特征集合大小呈二次增长。

关键词

引用

@article{arxiv.1808.00300,
  title  = {Learning Visual Question Answering by Bootstrapping Hard Attention},
  author = {Mateusz Malinowski and Carl Doersch and Adam Santoro and Peter Battaglia},
  journal= {arXiv preprint arXiv:1808.00300},
  year   = {2018}
}

备注

ECCV 2018