面向弱监督视频时刻定位的反事实跨模态推理
计算机视觉与模式识别
2023-10-17 v2
摘要
视频时刻定位旨在根据自然语言查询检索未修剪视频的目标片段。弱监督方法近来受到关注,因为目标片段的精确时间位置并非总可获得。然而,弱监督方法面临的最大挑战之一在于由粗粒度时间标注引发的视频与语言之间的不匹配。为精炼视觉-语言对齐,近期工作通过重建被掩码查询在正、负视频候选片段之间对比跨模态相似度。然而,重建可能受到未掩码部分与掩码部分之间潜在虚假相关的影响,这扭曲了恢复过程,并因掩码词未完全从跨模态知识中重建而进一步降低对比学习的效果。本文中,我们通过一种新提出的反事实跨模态推理方法发现并缓解该虚假相关。具体而言,我们首先将查询重建表述为跨模态与查询知识的聚合因果效应。随后通过在此聚合中引入反事实跨模态知识,显式建模未掩码部分对重建的虚假影响。最后,通过抑制被掩码查询的单模态效应,我们可修正视频候选片段的重建以执行合理的对比学习。大量实验评估证明了我们所提方法的有效性。代码见 \href{https://github.com/sLdZ0306/CCR}{https://github.com/sLdZ0306/CCR}。
引用
@article{arxiv.2308.05648,
title = {Counterfactual Cross-modality Reasoning for Weakly Supervised Video Moment Localization},
author = {Zezhong Lv and Bing Su and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2308.05648},
year = {2023}
}
备注
Accepted by ACM MM 2023