面向视频问答的视觉因果场景精炼
计算机视觉与模式识别
2023-08-02 v2
摘要
现有的视频问答(VideoQA)方法常受不同模态间虚假相关性的困扰,导致无法识别主导视觉证据与问题意图。此外,这些方法如同黑盒,难以在问答过程中解释视觉场景。本文为发现作为生成可靠答案之视觉因果场景的关键视频片段与帧,对 VideoQA 进行因果分析并提出一种跨模态因果关系推理框架,称为视觉因果场景精炼(VCSR)。特别地,我们引入一组因果前门干预操作,在片段与帧两个层面显式寻找视觉因果场景。我们的 VCSR 包含两个关键模块:i) 问题引导精炼器(QGR)模块,其由问题语义引导精炼连续视频帧,以获得更具代表性的片段特征用于因果前门干预;ii) 因果场景分离器(CSS)模块,其基于视觉-语言因果相关性发现一组视觉因果与非因果场景,并以对比学习的方式估计场景分离干预的因果效应。在 NExT-QA、Causal-VidQA 和 MSRVTT-QA 数据集上的大量实验证明了我们的 VCSR 在发现视觉因果场景与实现鲁棒视频问答方面的优越性。代码见 https://github.com/YangLiu9208/VCSR。
引用
@article{arxiv.2305.04224,
title = {Visual Causal Scene Refinement for Video Question Answering},
author = {Yushen Wei and Yang Liu and Hong Yan and Guanbin Li and Liang Lin},
journal= {arXiv preprint arXiv:2305.04224},
year = {2023}
}
备注
Accepted by ACM MM 2023