中文

去噪后检索:基于文本条件的视频去噪用于视频时刻检索

计算机视觉与模式识别 2025-08-18 v1

摘要

当前基于文本驱动的视频时刻检索(VMR)方法会对包括无关内容在内的所有视频片段进行编码,这会破坏多模态对齐并阻碍优化。为此,我们提出了一种去噪后检索的范式,显式地从视频中过滤文本无关片段,然后利用净化后的多模态表示检索目标时刻。遵循此范式,我们引入了去噪后检索网络(DRNet),包括文本条件去噪(TCD)和文本重构反馈(TRF)模块。TCD集成了跨注意力和结构化状态空间模块,以动态识别噪声片段并生成噪声掩码以净化多模态视频表示。TRF进一步从净化后的视频表示中提炼出单个查询嵌入,并将其与文本嵌入对齐,用作训练期间去噪的辅助监督。最后,我们在净化后的视频表示上使用文本嵌入执行条件检索,以实现准确的VMR。在Charades-STA和QVHighlights数据集上的实验表明,我们的方法在所有指标上均优于最新方法。此外,我们的去噪后检索范式具有可适应性,可无缝集成到先进的VMR模型中以提升性能。

关键词

引用

@article{arxiv.2508.11313,
  title  = {Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval},
  author = {Weijia Liu and Jiuxin Cao and Bo Miao and Zhiheng Fu and Xuelin Zhu and Jiawei Ge and Bo Liu and Mehwish Nasim and Ajmal Mian},
  journal= {arXiv preprint arXiv:2508.11313},
  year   = {2025}
}

备注

Accepted by IJCAI 2025