中文

面向视频问答的不变 grounding 方法

计算机视觉与模式识别 2022-06-07 v1

摘要

视频问答(VideoQA)是回答关于视频的问题的任务。其核心在于理解视频中的视觉场景与问题中的语言语义之间的对齐以得出答案。在主流 VideoQA 模型中,典型的学习目标经验风险最小化(ERM)将视频-问题对与答案之间的表层相关性作为对齐。然而,ERM 可能存在问题,因为它倾向于过度利用与问题无关的场景与答案之间的伪相关性,而非考察问题关键场景的因果效应。因此,VideoQA 模型存在推理不可靠的问题。在本工作中,我们首先从因果视角审视 VideoQA,并论证不变 grounding 是排除伪相关性的关键。为此,我们提出一种新的学习框架,即面向视频问答的不变 Grounding(IGV),以 grounding 问题关键场景,其与答案的因果关系在对补集进行不同干预时保持不变。通过 IGV,VideoQA 模型被迫使回答过程免受伪相关性的负面影响,从而显著提升推理能力。在三个基准数据集上的实验验证了 IGV 在准确率、视觉可解释性和泛化能力方面相对于主流基线的优越性。

关键词

引用

@article{arxiv.2206.02349,
  title  = {Invariant Grounding for Video Question Answering},
  author = {Yicong Li and Xiang Wang and Junbin Xiao and Wei Ji and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2206.02349},
  year   = {2022}
}

备注

CVPR2022 Oral