中文

VCD:面向跨模态问题推理的视觉因果发现

计算机视觉与模式识别 2023-12-14 v2

摘要

现有的视觉问题推理方法通常未能显式发现内在因果机制,且忽略了对跨模态事件时间性与因果性的联合建模。本文提出一种名为跨模态问题推理(CMQR)的视觉问题推理框架,通过因果干预发现时间因果结构并缓解视觉伪相关。为显式发现视觉因果结构,提出视觉因果发现(VCD)架构,以在时间上定位问题关键场景,并通过基于注意力的前门因果干预模块(称为局部-全局因果注意力模块,LGCAM)解耦视觉伪相关。为对齐语言语义与时空表示之间的细粒度交互,我们构建了交互式视觉-语言 Transformer(IVLT),建立视觉与语言内容之间的多模态共现交互。在四个数据集上的大量实验证明了 CMQR 在发现视觉因果结构与实现鲁棒问题推理方面的优越性。

关键词

引用

@article{arxiv.2304.08083,
  title  = {VCD: Visual Causality Discovery for Cross-Modal Question Reasoning},
  author = {Yang Liu and Ying Tan and Jingzhou Luo and Weixing Chen},
  journal= {arXiv preprint arXiv:2304.08083},
  year   = {2023}
}

备注

12 pages, 6 figures. arXiv admin note: substantial text overlap with arXiv:2207.12647