视频时刻检索的无标题查询
计算机视觉与模式识别
2026-03-04 v1
摘要
本文探讨了现有视频时刻检索(VMR)方法在基于标题查询训练但基于搜索查询评估时的性能下降问题,尤其是DETR架构。为此,我们通过修改三个公开VMR数据集(HD-EPIC、YouCook2和ActivityNet-Captions)中的文本查询,引入了三个基准测试。我们的分析揭示了两个关键的泛化挑战:(i) 语言鸿沟,源自搜索查询的语言描述不足; (ii) 多时刻鸿沟,由从单时刻查询转向多时刻查询所致。我们还识别出这些架构中的一个关键问题——主动解码器-查询崩溃——是导致对多时刻实例泛化性能差的主要原因。我们通过架构修改来缓解此问题,有效增加主动解码器查询的数量。大量实验表明,我们的方法在搜索查询上提升了最高可达14.82%的mAP_m,在多时刻搜索查询上提升了最高可达21.83%的mAP_m。代码、模型和数据均已在项目网页提供: https://davidpujol.github.io/beyond-vmr/
引用
@article{arxiv.2603.02363,
title = {Beyond Caption-Based Queries for Video Moment Retrieval},
author = {David Pujol-Perich and Albert Clapés and Dima Damen and Sergio Escalera and Michael Wray},
journal= {arXiv preprint arXiv:2603.02363},
year = {2026}
}
备注
CVPR 2026 Camera-ready version