VCD:面向跨模态问题推理的视觉因果发现
计算机视觉与模式识别
2023-12-14 v2
摘要
现有的视觉问题推理方法通常未能显式发现内在因果机制,且忽略了对跨模态事件时间性与因果性的联合建模。本文提出一种名为跨模态问题推理(CMQR)的视觉问题推理框架,通过因果干预发现时间因果结构并缓解视觉伪相关。为显式发现视觉因果结构,提出视觉因果发现(VCD)架构,以在时间上定位问题关键场景,并通过基于注意力的前门因果干预模块(称为局部-全局因果注意力模块,LGCAM)解耦视觉伪相关。为对齐语言语义与时空表示之间的细粒度交互,我们构建了交互式视觉-语言 Transformer(IVLT),建立视觉与语言内容之间的多模态共现交互。在四个数据集上的大量实验证明了 CMQR 在发现视觉因果结构与实现鲁棒问题推理方面的优越性。
引用
@article{arxiv.2304.08083,
title = {VCD: Visual Causality Discovery for Cross-Modal Question Reasoning},
author = {Yang Liu and Ying Tan and Jingzhou Luo and Weixing Chen},
journal= {arXiv preprint arXiv:2304.08083},
year = {2023}
}
备注
12 pages, 6 figures. arXiv admin note: substantial text overlap with arXiv:2207.12647