用于克服语言先验问题的视觉扰动感知协同学习
计算机视觉与模式识别
2022-07-26 v1
摘要
近期若干研究指出,现有的视觉问答(VQA)模型严重受制于语言先验问题,即捕捉问题类型与答案之间的表面统计相关性而忽略图像内容。大量工作致力于通过构建精细模型或引入额外视觉标注来增强图像依赖性。然而,这些方法未能充分探究视觉线索如何显式影响所学答案表示,而这对于缓解语言依赖至关重要。此外,它们通常强调所学答案表示的类级判别,忽视了更细粒度的实例级模式并需要进一步优化。本文从视觉扰动校准的视角提出一种新颖的协同学习方案,可通过学习实例级特征更好地探究细粒度视觉效应并缓解语言先验问题。具体而言,我们设计了一个视觉控制器来构建两种具有不同扰动程度的精心制作图像,基于此,通过两个精心设计的判别器实现实例内不变性与实例间判别的协同学习。此外,我们在潜空间上实施信息瓶颈调制器以进一步减轻偏差并校准表示。我们将视觉扰动感知框架施加于三个正统基线,在两个诊断性 VQA-CP 基准数据集上的实验结果明显证明了其有效性。另外,我们也在平衡的 VQA 基准上验证了其鲁棒性。
引用
@article{arxiv.2207.11850,
title = {Visual Perturbation-aware Collaborative Learning for Overcoming the Language Prior Problem},
author = {Yudong Han and Liqiang Nie and Jianhua Yin and Jianlong Wu and Yan Yan},
journal= {arXiv preprint arXiv:2207.11850},
year = {2022}
}
备注
13 pages, 10 figures, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence