从词汇扰动中学习以实现一致的视觉问答
计算机视觉与模式识别
2020-12-24 v2
摘要
现有的视觉问答 (VQA) 模型往往脆弱且对输入变化敏感。本文中,我们提出一种基于模块化网络的新方法来解决该问题,该方法创建两个由语言扰动相关联的问题,并在训练期间正则化它们之间的视觉推理过程以保持一致。我们表明我们的框架显著改善了一致性与泛化能力,证明了受控语言扰动作为 VQA 模型有用且当前未被充分利用的训练与正则化工具的价值。我们还提出了 VQA 扰动配对 (VQA P2),一种新颖、低成本的基准与增广流程,用于创建 VQA 问题的可控语言变体。我们的基准独特地利用了大规模语言资源,与生成式方法相比避免了人工标注开销,同时保持了数据质量。我们使用 VQA P2 对现有 VQA 模型进行基准测试,并针对每类语言变体给出鲁棒性分析。
引用
@article{arxiv.2011.13406,
title = {Learning from Lexical Perturbations for Consistent Visual Question Answering},
author = {Spencer Whitehead and Hui Wu and Yi Ren Fung and Heng Ji and Rogerio Feris and Kate Saenko},
journal= {arXiv preprint arXiv:2011.13406},
year = {2020}
}
备注
14 pages, 8 figures