中文

视频时刻检索的无标题查询

计算机视觉与模式识别 2026-03-04 v1

摘要

本文探讨了现有视频时刻检索(VMR)方法在基于标题查询训练但基于搜索查询评估时的性能下降问题,尤其是DETR架构。为此,我们通过修改三个公开VMR数据集(HD-EPIC、YouCook2和ActivityNet-Captions)中的文本查询,引入了三个基准测试。我们的分析揭示了两个关键的泛化挑战:(i) 语言鸿沟,源自搜索查询的语言描述不足; (ii) 多时刻鸿沟,由从单时刻查询转向多时刻查询所致。我们还识别出这些架构中的一个关键问题——主动解码器-查询崩溃——是导致对多时刻实例泛化性能差的主要原因。我们通过架构修改来缓解此问题,有效增加主动解码器查询的数量。大量实验表明,我们的方法在搜索查询上提升了最高可达14.82%的mAP_m,在多时刻搜索查询上提升了最高可达21.83%的mAP_m。代码、模型和数据均已在项目网页提供: https://davidpujol.github.io/beyond-vmr/

关键词

引用

@article{arxiv.2603.02363,
  title  = {Beyond Caption-Based Queries for Video Moment Retrieval},
  author = {David Pujol-Perich and Albert Clapés and Dima Damen and Sergio Escalera and Michael Wray},
  journal= {arXiv preprint arXiv:2603.02363},
  year   = {2026}
}

备注

CVPR 2026 Camera-ready version