中文

去混杂图像描述生成:一种因果回顾

计算机视觉与模式识别 2023-12-05 v2

摘要

视觉-语言任务中的数据集偏置正成为阻碍我们领域进展的主要问题之一。现有解决方案缺乏对现代图像描述生成器为何容易陷入数据集偏置的系统性分析。在本文中,我们提出一个新视角:去混杂图像描述生成(Deconfounded Image Captioning, DIC),以找出该问题的答案,进而回顾现代神经图像描述生成器,并最终提出一个 DIC 框架:DICv1.0,以缓解数据集偏置带来的负面影响。DIC 基于因果推断,其两个原则:后门调整与前门调整,帮助我们回顾以往研究并设计新的有效模型。特别地,我们展示了 DICv1.0 能够增强两种流行的描述生成模型,并能在具有挑战性的 MS COCO 数据集的 Karpathy 划分与在线划分上分别取得单模型 131.1 CIDEr-D 与 128.4 c40 CIDEr-D。有趣的是,DICv1.0 是我们因果回顾的自然推导,这为图像描述生成开辟了有前景的方向。

关键词

引用

@article{arxiv.2003.03923,
  title  = {Deconfounded Image Captioning: A Causal Retrospect},
  author = {Xu Yang and Hanwang Zhang and Jianfei Cai},
  journal= {arXiv preprint arXiv:2003.03923},
  year   = {2023}
}