通过细粒度因果干预消除视觉问答中的语言偏差
计算机视觉与模式识别
2024-10-15 v1 人工智能
摘要
尽管视觉问答(VQA)取得了显著进展,但缓解由文本信息引入的语言偏差的挑战仍未解决。先前的方法从粗粒度角度捕捉语言偏差。然而,句子中的细粒度信息,如上下文和关键词,可能导致不同的偏差。由于忽略了细粒度信息,大多数现有方法未能充分捕捉语言偏差。在本文中,我们提出了一种名为CIBi的新型因果干预训练方案,以从更细粒度的角度消除语言偏差。具体来说,我们将语言偏差分为上下文偏差和关键词偏差。我们采用因果干预和对比学习来消除上下文偏差并改进多模态表示。此外,我们设计了一个基于反事实生成的新问题专用分支,以蒸馏和消除关键词偏差。实验结果表明,CIBi适用于各种VQA模型,并取得了有竞争力的性能。
引用
@article{arxiv.2410.10184,
title = {Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention},
author = {Ying Liu and Ge Bai and Chenji Lu and Shilong Li and Zhang Zhang and Ruifang Liu and Wenbin Guo},
journal= {arXiv preprint arXiv:2410.10184},
year = {2024}
}