中文

反事实 VQA:一种语言偏见的因果视角

计算机视觉与模式识别 2021-04-02 v4 计算与语言

摘要

VQA 模型可能倾向于将语言偏见作为捷径,从而未能充分从视觉与语言中学习多模态知识。近期提出的去偏方法试图在推理时排除语言先验。然而,它们未能将整体中的“好”语言上下文与“坏”语言偏见解耦。本文中,我们探究如何缓解 VQA 中的语言偏见。受因果效应启发,我们提出了一种新颖的反事实推理框架,其使我们能够捕捉语言偏见作为问题对答案的直接因果效应,并通过从总因果效应中减去直接语言效应来削弱语言偏见。实验表明,我们提出的反事实推理框架 1)可泛化至各类 VQA 主干与融合策略,2)在语言偏见敏感的 VQA-CP 数据集上取得有竞争力的性能,同时在平衡的 VQA v2 数据集上无需任何增广数据即表现稳健。代码见 https://github.com/yuleiniu/cfvqa。

关键词

引用

@article{arxiv.2006.04315,
  title  = {Counterfactual VQA: A Cause-Effect Look at Language Bias},
  author = {Yulei Niu and Kaihua Tang and Hanwang Zhang and Zhiwu Lu and Xian-Sheng Hua and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2006.04315},
  year   = {2021}
}

备注

Accepted by CVPR 2021