中文

面向视频语料时刻检索的选择性查询引导去偏

计算机视觉与模式识别 2025-04-15 v3

摘要

视频时刻检索(VMR)旨在未裁剪视频中定位与给定文本查询相关的目标时刻。现有检索系统倾向于将检索偏置作为捷径,因而未能充分学习查询与视频间的多模态交互。该检索偏置源于学习查询与时刻间频繁的共现模式,这种模式将查询中提及的物体(如铅笔)与物体频繁出现的视频时刻(如用铅笔书写的场景)虚假关联,从而收敛于有偏的时刻预测。尽管近期去偏方法聚焦于消除该检索偏置,我们认为这些有偏预测有时应当保留,因为许多查询中偏置预测反而有益。为调和此检索偏置,我们提出选择性查询引导去偏网络(SQuiDNet),其包含以下两个主要特性:(1)有偏时刻检索,有意揭示查询物体中固有的有偏时刻;(2)选择性查询引导去偏,由查询语义引导执行选择性去偏。我们在三个时刻检索基准(即 TVR、ActivityNet、DiDeMo)上的实验结果展示了 SQuiDNet 的有效性,定性分析表明其可解释性有所提升。

关键词

引用

@article{arxiv.2210.08714,
  title  = {Selective Query-guided Debiasing for Video Corpus Moment Retrieval},
  author = {Sunjae Yoon and Ji Woo Hong and Eunseop Yoon and Dahyun Kim and Junyeong Kim and Hee Suk Yoon and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2210.08714},
  year   = {2025}
}

备注

16 pages, 6 figures, Accepted in ECCV 2022