点到跨度:用于导航未见过的长时间段视频的零样本时序检索
计算机视觉与模式识别
2025-12-12 v1
摘要
零样本长视频时序检索(ZLVMR)是指在没有任务特定训练的情况下,使用自然语言查询在小时级视频中识别时间段的任务。LVMR 的核心技术挑战在于计算上无法在单次处理中对整个冗长视频进行处理。此限制导致‘搜索-精炼’方法成为 LVMR 的主导范式:快速缩小候选范围,仅对这些片段进行分析。然而,现有方法面临严重局限。常规监督学习虽消耗大量资源,却存在可扩展性有限和泛化性差的问题。而现有零样本方法也失败了,面临双重挑战:(1)其启发式策略导致‘搜索’阶段候选爆炸,(2)易受语义偏差影响的‘精炼’阶段需要高成本的视觉语言模型进行验证,造成显著计算开销。我们提出了 **P**oint-**to**-**S**pan(P2S),一种新颖的无训练框架,以克服‘搜索’和‘精炼’阶段的效率与成本挑战。P2S 通过两个关键创新克服这些挑战:用于防止搜索阶段候选爆炸的‘自适应跨度生成器’,以及无需依赖高成本 VLM 验证的‘查询分解’来精炼候选。就我们知识而言,P2S 是首个能够在小时级视频中进行时序定位的零样本框架,显著超越监督的最先进方法(例如在 MAD 上 [email protected] 提升 3.7%)。
引用
@article{arxiv.2512.10363,
title = {Point to Span: Zero-Shot Moment Retrieval for Navigating Unseen Hour-Long Videos},
author = {Mingyu Jeon and Jisoo Yang and Sungjin Han and Jinkwon Hwang and Sunjae Yoon and Jonghee Kim and Junyeoung Kim},
journal= {arXiv preprint arXiv:2512.10363},
year = {2025}
}