中文

ShotFinder:基于网页搜索的想象驱动开放域视频片刻检索

计算机视觉与模式识别 2026-02-17 v3 人工智能

摘要

近年来,大语言模型 (LLM) 在信息检索领域取得了快速进展,但现有研究主要聚焦于文本或静态多模态设置。开放域视频片刻检索涉及更丰富的时间结构和更复杂的语义,仍缺乏系统化的基准测试和分析。为填补这一空白,我们引入 ShotFinder,一种将编辑要求形式化为关键帧导向片刻描述的基准,引入五类可控单因素约束:时间顺序、颜色、视觉风格、音频和分辨率。我们从 YouTube 精选 1,210 个高质量样本,覆盖 20 个主题类别,使用大模型生成并进行人工验证。基于此基准,我们提出 ShotFinder,一个文本驱动的三阶段检索与局部化管道:(1) 通过视频想象进行查询扩展,(2) 使用搜索引擎进行候选视频检索,(3) 根据描述进行时间局部化。在多个封闭源和开源模型上的实验显示,与人类水平存在显著差距,不同约束之间的表现不均衡:时间局部化相对可行,而颜色和视觉风格仍是主要挑战。这些结果揭示了开放域视频片刻检索仍是多模态大模型尚未克服的关键能力。

关键词

引用

@article{arxiv.2601.23232,
  title  = {ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search},
  author = {Tao Yu and Haopeng Jin and Hao Wang and Shenghua Chai and Yujia Yang and Junhao Gong and Jiaming Guo and Minghui Zhang and Xinlong Chen and Zhenghao Zhang and Yuxuan Zhou and Yufei Xiong and Shanbin Zhang and Jiabing Yang and Hongzhu Yi and Xinming Wang and Cheng Zhong and Xiao Ma and Zhang Zhang and Yan Huang and Liang Wang},
  journal= {arXiv preprint arXiv:2601.23232},
  year   = {2026}
}

备注

28 pages, 7 figures, Project website: https://github.com/yutao1024/ShotFinder