中文

从词汇扰动中学习以实现一致的视觉问答

计算机视觉与模式识别 2020-12-24 v2

摘要

现有的视觉问答 (VQA) 模型往往脆弱且对输入变化敏感。本文中,我们提出一种基于模块化网络的新方法来解决该问题,该方法创建两个由语言扰动相关联的问题,并在训练期间正则化它们之间的视觉推理过程以保持一致。我们表明我们的框架显著改善了一致性与泛化能力,证明了受控语言扰动作为 VQA 模型有用且当前未被充分利用的训练与正则化工具的价值。我们还提出了 VQA 扰动配对 (VQA P2),一种新颖、低成本的基准与增广流程,用于创建 VQA 问题的可控语言变体。我们的基准独特地利用了大规模语言资源,与生成式方法相比避免了人工标注开销,同时保持了数据质量。我们使用 VQA P2 对现有 VQA 模型进行基准测试,并针对每类语言变体给出鲁棒性分析。

关键词

引用

@article{arxiv.2011.13406,
  title  = {Learning from Lexical Perturbations for Consistent Visual Question Answering},
  author = {Spencer Whitehead and Hui Wu and Yi Ren Fung and Heng Ji and Rogerio Feris and Kate Saenko},
  journal= {arXiv preprint arXiv:2011.13406},
  year   = {2020}
}

备注

14 pages, 8 figures