仅扫描一次:长视频中快速时间定位的端到端框架
计算机视觉与模式识别
2024-02-20 v2
摘要
视频时间定位旨在找出与查询描述匹配的视频片段。尽管近期在短视频(如数分钟)上取得进展,长视频(如数小时)中的时间定位仍处于早期阶段。应对该挑战的常用做法是采用滑动窗口,但因窗口内帧数有限,效率低且缺乏灵活性。本工作中,我们提出一种用于快速时间定位的端到端框架,能够以\textbf{单次}网络执行建模长达数小时的视频。我们的流程以由粗到精方式构建:首先从非重叠视频片段(即锚点)提取上下文知识,随后以响应查询强烈的锚点补充详细内容知识。除极高的流程效率外,本方法的另一优势是捕捉长程时间关联的能力,这得益于将整段视频作为整体建模,从而有助于更精准的定位。实验结果表明,在长视频数据集 MAD 与 Ego4d 上,我们的方法显著优于当前最优方法,并分别取得\textbf{14.6} / \textbf{102.8} 更高效率。项目见 \url{https://github.com/afcedf/SOONet.git}。
引用
@article{arxiv.2303.08345,
title = {Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos},
author = {Yulin Pan and Xiangteng He and Biao Gong and Yiliang Lv and Yujun Shen and Yuxin Peng and Deli Zhao},
journal= {arXiv preprint arXiv:2303.08345},
year = {2024}
}
备注
11 pages, 8 figures