中文

损失重缩放 VQA:从类不平衡视角重审语言先验问题

计算机视觉与模式识别 2021-12-15 v4

摘要

近期研究指出,许多成熟的视觉问答(VQA)模型深受语言先验问题的影响,即基于文本问题与答案之间的共现模式而非推理视觉内容来进行预测。为应对该问题,大多数现有方法侧重于增强视觉特征学习,以减少这种表层文本捷径对 VQA 模型决策的影响。然而,鲜有研究致力于为其内在成因提供显式解释。因而缺乏良好指引以使研究界以有目的的方式推进,导致在克服这一重要问题时模型构建的困惑。本文中,我们提出从类不平衡视角解释 VQA 中的语言先验问题。具体而言,我们设计了一种新颖的解释方案, whereby 在同一问题类型下误预测的常见答案与稀疏答案的损失在训练后期被清晰展现。它显式揭示了为何 VQA 模型倾向于对训练集中正确答案稀疏的给定问题,生成常见但明显错误的答案。基于该观察,我们进一步开发了一种新颖的损失重缩放方法,根据训练数据统计为每个答案分配不同权重以计算最终损失。我们将该方法应用于三个基线,且在两个 VQA-CP 基准数据集上的实验结果明显证明了其有效性。此外,我们也在其他计算机视觉任务(如人脸识别和图像分类)上验证了类不平衡解释方案的合理性。

关键词

引用

@article{arxiv.2010.16010,
  title  = {Loss re-scaling VQA: Revisiting the LanguagePrior Problem from a Class-imbalance View},
  author = {Yangyang Guo and Liqiang Nie and Zhiyong Cheng and Qi Tian and Min Zhang},
  journal= {arXiv preprint arXiv:2010.16010},
  year   = {2021}
}