中文

MomentSeeker:面向长视频时刻检索的任务导向基准

计算机视觉与模式识别 2026-01-13 v5 人工智能

摘要

准确定位长视频中的关键时刻对于解决长视频理解(LVU)任务至关重要。然而,现有的基准要么在视频时长和任务多样性方面受到严格限制,要么仅关注端到端 LVU 性能,这使得它们不适用于评估关键时刻是否可以准确访问。为此,我们提出 MomentSeeker,一个新的长视频时刻检索(LMVR)基准,具有以下特点。首先,基于时长超过 1200 秒且来自多个领域(如电影、异常、体感和运动)的长视频创建。其次,覆盖三级的真实场景:全局级、事件级和对象级,涵盖诸如动作识别、对象定位和因果推理等常见任务。第三,包含多种形式的查询,包括文本查询、图像条件查询和视频条件查询。在 MomentSeeker 之上,我们对生成式方法(直接使用大语言多模态模型)和检索式方法(利用视频检索器)进行了全面的实验。我们的结果揭示了尽管来自最新长视频大语言多模态模型和任务特定微调带来了改进,但在长视频时刻检索的准确性和效率方面仍存在重大挑战。我们已公开发布 MomentSeeker(https://yhy-2000.github.io/MomentSeeker/)以促进该领域的未来研究。

关键词

引用

@article{arxiv.2502.12558,
  title  = {MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval},
  author = {Huaying Yuan and Jian Ni and Zheng Liu and Yueze Wang and Junjie Zhou and Zhengyang Liang and Bo Zhao and Zhao Cao and Zhicheng Dou and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2502.12558},
  year   = {2026}
}