通过因果推断提升时序句子定位
计算机视觉与模式识别
2025-08-26 v2 多媒体
摘要
时序句子定位(TSG)旨在识别与给定文本查询在语义上对应的未裁剪视频中的相关时刻。尽管已有研究在此方面取得了显著进展,但往往忽视了视频和文本查询之间潜在相关性的问题。这类潜在相关性源自两个主要因素:(1)文本数据中固有的偏差,例如特定动词或短语的频繁共现;(2)模型倾向于过拟合到视频内容中显著或重复的模式。这种偏差会导致模型将文本线索与错误的视觉时刻关联,从而产生不可靠的预测并在分布外示例上表现差。为克服这些限制,我们提出了一种新型 TSG 框架,采用因果干预和反事实推理,通过因果推断消除潜在相关性,增强模型的鲁棒性。具体而言,我们从因果视角对 TSG 任务进行建模,构建结构因果模型。为解决反映文本对特定动词或短语偏好的不可观测混杂因素,提出文本因果干预,利用 do 微积分估计因果效应。此外,进行基于视频特征的反事实推理,通过构建仅聚焦于视频特征、排除查询和多模态特征融合的反事实情景,以此消除视频影响。实验在公开数据集上表明,所提方法优于现有方法。代码已公开:https://github.com/Tangkfan/CICR。
引用
@article{arxiv.2507.04958,
title = {Boosting Temporal Sentence Grounding via Causal Inference},
author = {Kefan Tang and Lihuo He and Jisheng Dang and Xinbo Gao},
journal= {arXiv preprint arXiv:2507.04958},
year = {2025}
}
备注
Accepted by ACM MM 2025