中文

超越基于问题的偏置:评估视觉问答中的多模态捷径学习

计算机视觉与模式识别 2021-09-02 v3 人工智能

摘要

我们为视觉问答(VQA)引入一种评估方法,以更好地诊断捷径学习的情况。当模型利用虚假统计规律性给出正确答案却并未真正部署期望行为时,就会发生此类情况。在将模型部署到现实世界之前,有必要识别数据集中可能的捷径并评估其使用。VQA研究界仅关注基于问题的捷径,例如模型可能主要依赖问题条件训练先验以“蓝色”回答“天空是什么颜色”,而很少考虑视觉证据。我们更进一步,考虑涉及问题与图像的多模态捷径。我们首先通过挖掘平凡预测规则(如词与视觉元素的共现)来识别流行VQA v2训练集中的潜在捷径。随后我们引入VQA反例(VQA-CE),一种基于我们的反例子集(即我们的规则导致错误答案的图像-问题-答案三元组)的评估协议。我们在对现有VQA方法的大规模研究中使用这一新评估。我们表明,即使最先进的模型也表现不佳,且现有减少偏置的技术在此背景下基本无效。我们的发现表明,以往关于VQA中基于问题的偏置的工作仅解决了复杂问题的一个方面。我们的方法代码可在 https://github.com/cdancette/detect-shortcuts 获取。

关键词

引用

@article{arxiv.2104.03149,
  title  = {Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question Answering},
  author = {Corentin Dancette and Remi Cadene and Damien Teney and Matthieu Cord},
  journal= {arXiv preprint arXiv:2104.03149},
  year   = {2021}
}

备注

Accepted at ICCV 2021. Code is available at https://github.com/cdancette/detect-shortcuts