中文

用于视频问答的等变与不变接地

计算与语言 2022-07-27 v1

摘要

视频问答(VideoQA)是回答关于视频的自然语言问题的任务。生成答案需要理解视频中视觉场景与问题中语言语义之间的相互作用。然而,大多数领先的 VideoQA 模型作为黑箱工作,使回答过程背后的视觉-语言对齐模糊不清。这种黑箱性质要求视觉可解释性来揭示“模型应观看视频的哪部分以回答问题?”。仅有少数工作以事后方式呈现视觉解释,其通过附加方法模拟目标模型的回答过程。尽管如此,该模拟难以忠实展现回答期间的视觉-语言对齐。我们关注内在可解释性而非事后可解释性,使回答过程透明。其核心是将问题关键线索作为产生答案的因果场景接地,同时将问题无关信息作为环境场景展开。从因果视角看待 VideoQA,我们设计了一个自解释框架:用于可解释 VideoQA 的等变与不变接地(EIGV)。具体而言,等变接地促使回答对因果场景和问题的语义变化敏感;相反,不变接地强制回答对环境场景的变化不敏感。通过将它们施加于回答过程,EIGV 能够区分因果场景与环境信息,并显式呈现视觉-语言对齐。在三个基准数据集上的大量实验证明了 EIGV 在准确率和视觉可解释性上相对于领先基线的优越性。

关键词

引用

@article{arxiv.2207.12783,
  title  = {Equivariant and Invariant Grounding for Video Question Answering},
  author = {Yicong Li and Xiang Wang and Junbin Xiao and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2207.12783},
  year   = {2022}
}

备注

MM22