高效部分相关视频检索中的主动时刻发现
计算机视觉与模式识别
2025-04-16 v1
摘要
部分相关视频检索 (PRVR) 是文本到视频检索中的一个实用且具挑战性的任务,视频为 untrimmed 且包含大量背景内容。此处的目标是在捕获文本查询与未剪辑视频之间部分对应关系方面寻求 effective 与 efficient 的解决方案。现有 PRVR 方法通常侧重于建模多尺度 clip 表示,但 suffer from 内容独立性和信息冗余,影响检索性能。为克服这些限制,我们提出一种 simple yet effective 的方法,称为主动时刻发现 (AMDNet)。我们致力于发现与查询语义一致的视频时刻。通过使用可学习的 span锚点捕获 distinct 时刻,并应用 masked 多时刻注意力以强调显著时刻同时抑制冗余背景,我们实现了更紧凑且信息丰富的视频表示。为进一步增强时刻建模,我们引入时刻多样性损失以鼓励不同时刻对应 distinct 区域,引入时刻相关性损失以促进语义查询相关时刻,这些损失与部分相关检索损失协同进行端到端优化。在两个大型视频数据集上进行的广泛实验表明,我们的 AMDNet 在优势和效率方面均显著领先。特别是,AMDNet 在 TVR 上的参数数量约为最新方法 GMMFormer 的 15.5 倍小,SumR 高出 6.0 分。
引用
@article{arxiv.2504.10920,
title = {Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering},
author = {Peipei Song and Long Zhang and Long Lan and Weidong Chen and Dan Guo and Xun Yang and Meng Wang},
journal= {arXiv preprint arXiv:2504.10920},
year = {2025}
}
备注
Accepted by IEEE Transactions on Multimedia (TMM) on January 19, 2025. The code is available at https://github.com/songpipi/AMDNet