面向事件级视觉问答的跨模态因果关系推理
计算机视觉与模式识别
2023-06-08 v8 人工智能
摘要
现有视觉问答方法常受跨模态伪相关性和过度简化的事件级推理过程所困,难以捕捉跨越视频的事件时序性、因果性与动态性。本文中,为应对事件级视觉问答任务,我们提出一种跨模态因果关系推理框架。具体而言,引入一组因果干预操作以发现视觉与语言模态间潜在的因果结构。我们的框架称为跨模态因果关系推理(Cross-Modal Causal RelatIonal Reasoning, CMCIR),包含三个模块:i) 因果感知视觉-语言推理(CVLR)模块,通过前门与后门因果干预协同解耦视觉与语言伪相关性;ii) 时空 Transformer(STT)模块,用于捕获视觉与语言语义间的细粒度交互;iii) 视觉-语言特征融合(VLFF)模块,用于自适应学习全局语义感知的视觉-语言表示。在四个事件级数据集上的大量实验证明了我们的 CMCIR 在发现视觉-语言因果结构及实现鲁棒事件级视觉问答方面的优越性。数据集、代码与模型见 https://github.com/HCPLab-SYSU/CMCIR。
引用
@article{arxiv.2207.12647,
title = {Cross-Modal Causal Relational Reasoning for Event-Level Visual Question Answering},
author = {Yang Liu and Guanbin Li and Liang Lin},
journal= {arXiv preprint arXiv:2207.12647},
year = {2023}
}
备注
17 pages, 9 figures. This work has been accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). The datasets, code and models are available at https://github.com/HCPLab-SYSU/CMCIR