中文

DualNet:用于视觉问答的领域不变网络

计算机视觉与模式识别 2017-05-05 v2

摘要

视觉问答(VQA)任务不仅弥合了图像与语言之间的鸿沟,还要求根据问题的语言语境理解图像内的特定内容,以生成准确的答案。因此,构建图像和文本的高效嵌入至关重要。我们实现了 DualNet,它通过分别执行两项操作,充分利用了图像和文本特征的判别能力。构建 DualNet 的集成进一步提升了性能。与普遍看法相反,尽管各自领域具有显著不同的属性,我们的方法在真实图像和抽象场景中均证明有效。我们的方法即使没有明确采用注意力机制,也能在真实图像类别中优于先前的 SOTA 方法,并且在抽象场景类别中也优于我们自己的 SOTA 方法,该方法近期在 VQA Challenge 2016 中荣获第一名。

关键词

引用

@article{arxiv.1606.06108,
  title  = {DualNet: Domain-Invariant Network for Visual Question Answering},
  author = {Kuniaki Saito and Andrew Shin and Yoshitaka Ushiku and Tatsuya Harada},
  journal= {arXiv preprint arXiv:1606.06108},
  year   = {2017}
}

备注

Accepted as an oral paper by ICME 2017