中文

面向去偏置图像文本匹配的因果推断方法

计算机视觉与模式识别 2024-08-23 v1 人工智能

摘要

先前的图像文本匹配方法在许多基准数据集上展现了卓越的性能,但大多数方法忽略了数据集中存在的偏置,这些偏置存在于单模态内部和跨模态之间,倾向于学习极度损害模型泛化能力的伪相关。此外,这些方法常常将大规模数据集中获取的偏性外部知识作为先验知识纳入图像文本匹配模型,这不可避免地会迫使模型进一步学习偏性关联。为此,本文首先利用结构因果模型(SCM)阐述单模态和跨模态混杂因子如何损害图像文本匹配。随后,我们采用背门调整方法,提出一种 innovative 的去混杂因果推断网络(DCIN)用于图像文本匹配任务。DCIN(1)分解单模态和跨模态混杂因子,并将其纳入视觉和文本特征编码阶段,有效地在图像文本匹配期间消除伪相关,(2)利用因果推断减轻外部知识的偏见。因此,模型能够学习因果关系,而非由数据集偏置引起的伪相关。对两个广为人知的基准数据集,即 Flickr30K 和 MSCOCO 进行大量实验,证明了我们所提出方法的优越性。

关键词

引用

@article{arxiv.2408.12292,
  title  = {Towards Deconfounded Image-Text Matching with Causal Inference},
  author = {Wenhui Li and Xinqi Su and Dan Song and Lanjun Wang and Kun Zhang and An-An Liu},
  journal= {arXiv preprint arXiv:2408.12292},
  year   = {2024}
}

备注

ACM MM