中文

RUBi:降低视觉问答中的单模态偏差

计算机视觉与模式识别 2020-03-24 v2 计算与语言 机器学习

摘要

视觉问答(VQA)是回答关于图像的问题的任务。一些 VQA 模型常利用单模态偏差,在不使用图像信息的情况下给出正确答案。因此,当在训练集分布之外的数据上评估时,它们的性能大幅下降。这一关键问题使它们不适用于真实场景。我们提出 RUBi,一种用于降低任意 VQA 模型中偏差的新学习策略。它降低最具偏差样本的重要性,即那些无需观看图像即可正确分类的样本。它隐式地迫使 VQA 模型使用两种输入模态,而非依赖问题与答案之间的统计规律性。我们利用一个仅基于问题的模型,通过识别这些不期望的规律被使用的时机来捕获语言偏差。它通过影响基 VQA 模型的预测,阻止其学习这些规律。这导致动态调整损失以补偿偏差。我们通过在 VQA-CP v2 上超越当前最先进(SOTA)结果来验证我们的贡献。该数据集专门设计用于评估 VQA 模型在测试时遇到与训练时不同的问题偏差时的鲁棒性。我们的代码可用:github.com/cdancette/rubi.bootstrap.pytorch

关键词

引用

@article{arxiv.1906.10169,
  title  = {RUBi: Reducing Unimodal Biases in Visual Question Answering},
  author = {Remi Cadene and Corentin Dancette and Hedi Ben-younes and Matthieu Cord and Devi Parikh},
  journal= {arXiv preprint arXiv:1906.10169},
  year   = {2020}
}

备注

NeurIPS 2019 http://papers.nips.cc/paper/8371-rubi-reducing-unimodal-biases-for-visual-question-answering