中文

SwapMix:诊断并正则化视觉问答中对视觉上下文的过度依赖

计算机视觉与模式识别 2022-04-06 v1 计算与语言 机器学习

摘要

尽管视觉问答(VQA)已取得快速进展,先前的研究仍对当前 VQA 模型的鲁棒性表示担忧。本文从一新视角——视觉上下文,研究 VQA 模型的鲁棒性。我们指出,模型过度依赖视觉上下文,即图像中与问题无关的物体,来进行预测。为诊断模型对视觉上下文的依赖并衡量其鲁棒性,我们提出一种简单而有效的扰动技术 SwapMix。SwapMix 通过将无关上下文物体的特征与数据集中其他物体的特征进行交换,从而扰动视觉上下文。利用 SwapMix,我们能够将具有代表性的 VQA 模型上超过 45% 的问题答案改变。此外,我们以完美视觉(perfect sight)训练模型,发现上下文过度依赖高度取决于视觉表征的质量。除诊断外,SwapMix 也可作为训练时的数据增强策略,以正则化上下文过度依赖。通过交换上下文物体特征,模型对上下文的依赖可被有效抑制。我们使用 SwapMix 研究了两个代表性 VQA 模型:协同注意力模型 MCAN 与大规模预训练模型 LXMERT。在流行的 GQA 数据集上的实验表明了 SwapMix 在诊断模型鲁棒性与正则化视觉上下文过度依赖两方面的有效性。我们的方法代码见 https://github.com/vipulgupta1011/swapmix。

关键词

引用

@article{arxiv.2204.02285,
  title  = {SwapMix: Diagnosing and Regularizing the Over-Reliance on Visual Context in Visual Question Answering},
  author = {Vipul Gupta and Zhuowan Li and Adam Kortylewski and Chenyu Zhang and Yingwei Li and Alan Yuille},
  journal= {arXiv preprint arXiv:2204.02285},
  year   = {2022}
}

备注

11 pages, Computer Vision and Pattern Recognition 2022