中文

基于因果干预的去混杂视频时刻检索

计算机视觉与模式识别 2021-06-04 v1

摘要

我们解决了视频时刻检索(VMR)任务,其目标是根据文本查询在视频中定位特定时刻。现有方法主要通过复杂的跨模态交互来建模查询与时刻之间的匹配关系。尽管这些方法有效,但当前模型大多利用数据集偏差而忽略视频内容,从而导致泛化性能较差。我们认为该问题是由 VMR 中隐藏的混杂因子(即时刻的时间位置)引起的,它在模型输入与预测之间产生了虚假关联。如何设计抵御时间位置偏差的鲁棒匹配模型至关重要,但据我们所知,尚未有针对 VMR 的研究。为填补这一研究空白,我们提出了一种受因果启发的 VMR 框架,该框架构建结构因果模型以捕捉查询和视频内容对预测的真实效应。具体而言,我们提出了去混杂跨模态匹配(DCM)方法以消除时刻位置的混杂效应。该方法首先解耦时刻表征以推断视觉内容的核心特征,然后基于后门调整对解耦后的多模态输入施加因果干预,迫使模型公平地考虑目标可能的各个位置。大量实验清楚地表明,我们的方法在准确率和泛化性方面均显著优于最先进的方法(代码:\color{blue}{\url{https://github.com/Xun-Yang/Causal_Video_Moment_Retrieval}})。

关键词

引用

@article{arxiv.2106.01534,
  title  = {Deconfounded Video Moment Retrieval with Causal Intervention},
  author = {Xun Yang and Fuli Feng and Wei Ji and Meng Wang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2106.01534},
  year   = {2021}
}

备注

This work has been accepted by SIGIR 2021