检索任意相关时刻:通用时刻检索基准与模型
计算机视觉与模式识别
2026-05-05 v1 多媒体
摘要
视频时刻检索(VMR)旨在在视频中定位与自然语言查询对应的时间段,但通常仅假设每个查询对应单个匹配时刻。这种假设在实际场景中不总是成立,查询可能对应多个或没有时刻。因此,我们提出了通用时刻检索(GMR),一种需要检索完整相关时刻集合或预测空集合的统一设置。为支持 GMR 的系统性研究,我们引入 Soccer-GMR,一个构建于具有挑战性足球视频的数据集,反映一般 GMR 场景,包含真实的负面和正面查询。该基准通过一种具备可调 duration 的半自动管道构建,包含人工验证,实现了可扩展的数据生成同时保持高质量标注。我们进一步设计了统一的评估协议,包含针对 null-set rejection、positive-query localization 和 end-to-end GMR 性能的互补指标。最后,我们在两种建模范式下建立了强大的基线:为判别式 VMR 模型设计的轻量级即插即用 GMR 适配器,以及为细调多模态大型语言模型(MLLM)设计的 GMR 量身定制的 GRPO reward。大量实验表明,所有指标均实现了一致的提升,并揭示了当前方法的关键局限性,将 GMR 定位为更真实和更具挑战性的视频语言理解基准。
引用
@article{arxiv.2605.02623,
title = {Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval},
author = {Yiming Ding and Siyu Cao and Luyuan Jiao and Yixuan Li and Zitong Wang and Zhiyong Liu and Lu Zhang},
journal= {arXiv preprint arXiv:2605.02623},
year = {2026}
}
备注
Code and dataset: https://github.com/dymm9977/generalized-moment-retrieval. Keywords: video moment retrieval, temporal grounding, benchmark, multi-modal learning