中文

基于跨模态因果关系对齐的视频问答 grounding

机器学习 2025-03-12 v1 计算与语言 计算机视觉与模式识别

摘要

视频问答 grounding (VideoQG) 需要模型在回答问题的同时推断出与答案相关的视频片段。然是的,现有的 VideoQG 方法通常会受到虚假的跨模态相关性的影响,导致无法识别与预期问题相对应的主导视觉场景。此外,视觉语言模型在面对诸如 VideoQG 等具有挑战性的下游任务时,表现出不忠实的泛化性能和缺乏鲁棒性。本文提出了一种新颖的 VideoQG 框架,称为交叉模态因果关系对齐 (Cross-modal Causal Relation Alignment, CRA),以消除虚假相关性并提高问题-答案与视频时间 grounding 之间的因果一致性。我们的 CRA 包含三个关键组件:i) 高斯平滑 grounding (GSG) 模块通过跨模态注意力估计时间区间,通过自适应高斯滤波器进行去噪;ii) 跨模态对齐 (CMA) 通过在估计的视频片段和 QA 特征之间进行双向对比学习来增强弱监督 VideoQG 的性能;iii) 显式因果干预 (ECI) 模块用于多模态去事后,分别涉及视觉的前门干预和语言的后门干预。在两个 VideoQG 数据集上的大量实验表明,我们的 CRA 在发现视觉 grounding 内容和实现稳健问题推理方面具有优势。代码已公开于 https://github.com/WissingChen/CRA-GQA。

关键词

引用

@article{arxiv.2503.07635,
  title  = {Cross-modal Causal Relation Alignment for Video Question Grounding},
  author = {Weixing Chen and Yang Liu and Binglin Chen and Jiandong Su and Yongsen Zheng and Liang Lin},
  journal= {arXiv preprint arXiv:2503.07635},
  year   = {2025}
}

备注

Accepted by CVPR 2025