中文

基于因果干预的弱监督视频对象定位

计算机视觉与模式识别 2021-12-02 v1 计算与语言

摘要

我们致力于弱监督视频对象定位(WSVOG)任务,该任务在模型学习期间仅提供视频-句子标注。其目标是将句子中所描述的对象定位到视频中的视觉区域,这是模式分析与机器学习所需的基础能力。尽管近期取得了进展,现有方法均深受虚假关联的严重影响,这会损害定位性能。本文从 WSVOG 的定义出发,从两方面指出虚假关联:(1)由于弱监督,关联本身与对象无关且极度模糊;(2)现有方法采用基于统计的匹配策略时,关联不可避免地受到观测偏差的混淆。鉴于此,我们设计了一个统一的因果框架,以学习去混淆的、与对象相关的关联,从而实现更准确、更鲁棒的视频对象定位。具体而言,我们从视频数据生成过程的角度,通过因果干预学习对象相关关联。为克服干预中缺乏细粒度监督的问题,我们提出了一种新颖的时空对抗对比学习范式。为进一步消除对象相关关联中伴随的混淆效应,我们通过后门调整进行因果干预以追求真实因果性。最终,去混淆的对象相关关联在统一因果框架下以端到端方式被学习和优化。在三个基准的 IID 和 OOD 测试集上的大量实验表明,其定位性能准确且鲁棒,优于当前最优方法。

关键词

引用

@article{arxiv.2112.00475,
  title  = {Weakly-Supervised Video Object Grounding via Causal Intervention},
  author = {Wei Wang and Junyu Gao and Changsheng Xu},
  journal= {arXiv preprint arXiv:2112.00475},
  year   = {2021}
}