中文

揭示视觉问答中的跨模态偏差:基于可能世界VQA的因果视角

计算机视觉与模式识别 2023-06-01 v1 计算与语言 多媒体

摘要

为提升VQA系统的泛化能力,近期许多研究尝试去除将问题或图像捷径连接到答案的虚假语言或视觉关联偏差。尽管有这些努力,现有文献未能同时处理视觉与语言的混杂效应。结果,当它们减少从一种模态学到的偏差时,通常会增加来自另一种模态的偏差。本文中,我们首先建模了一个同时导致语言与视觉偏差的混杂效应,然后提出一种反事实推理以消除该效应的影响。以此策略训练的模型能够同时且高效地减少视觉与语言偏差。据我们所知,这是首个利用因果解释消除关系(explain-away relations)减少VQA中视觉与语言混杂效应所致偏差的工作。我们为方法配套了一种解释消除策略,相较于现有方法(这一直是开放问题),提升了带数值答案问题的准确率。所提方法在VQA-CP v2数据集上优于SOTA方法。

关键词

引用

@article{arxiv.2305.19664,
  title  = {Unveiling Cross Modality Bias in Visual Question Answering: A Causal View with Possible Worlds VQA},
  author = {Ali Vosoughi and Shijian Deng and Songyang Zhang and Yapeng Tian and Chenliang Xu and Jiebo Luo},
  journal= {arXiv preprint arXiv:2305.19664},
  year   = {2023}
}

备注

22 pages