中文

面向少样本视觉问答的组合式表示学习

计算机视觉与模式识别 2021-02-23 v1

摘要

当前的视觉问答方法在具有大量训练数据的答案上表现良好,但在仅有少量样本的新答案上准确率有限。然而,人类仅凭少量观察即可快速适应这些新类别,因为他们学会组织先前见过的概念来推断新类,而这很少被深度学习方法所探索。因此,本文提出从具有充足数据的答案中提取属性,随后将这些属性组合以约束少样本答案的学习。我们在无需任何人工标注的情况下生成了包含多种答案及其属性的少样本 VQA 数据集。基于该数据集,我们构建了属性网络,通过从图像局部而非整体学习特征来解耦属性。在 VQA v2.0 验证集上的实验结果证明了我们所提出的属性网络以及答案与其对应属性之间约束的有效性,同时也表明我们的方法能够处理训练样本稀少的答案。

关键词

引用

@article{arxiv.2102.10575,
  title  = {Learning Compositional Representation for Few-shot Visual Question Answering},
  author = {Dalu Guo and Dacheng Tao},
  journal= {arXiv preprint arXiv:2102.10575},
  year   = {2021}
}