中文

基于大规模预训练模型的无训练视频时序 grounding

计算机视觉与模式识别 2024-08-30 v1

摘要

视频时序 grounding 旨在识别未剪辑视频中与给定自然语言查询最相关的视频片段。现有的视频时序定位模型依赖特定数据集进行训练,数据收集成本高昂,但在跨数据集和超出分布 (OOD) 设置下表现差。本文提出一种基于预训练大模型的无训练视频时序 grounding (TFVTG) 方法。将提案枚举于视频中并利用预训练视觉语言模型 (VLM) 按视觉-语言对齐性选择最佳提案是一种朴素的基线方法。然而,大多数现有 VLM 在图像-文本对或修剪视频片段-文本对上进行训练,导致其难以 (1) 把握多个事件在同一视频中的关系并区分其时序边界;(2) 理解并敏感地把握视频中事件动态转换。为此,我们提出利用大语言模型 (LLM) 分析查询文本中包含的多个子事件,并分析这些事件之间的时序顺序和关系。其次,将子事件划分为动态转换和静态状态部分,并提出动态和静态评分函数以更好地评估事件与描述之间的相关性。最后,对于每个子事件描述,我们使用 VLM locate top-k 提案,并利用 LLM 提供的子事件之间的顺序和关系进行筛选和集成。我们的方法在没有任何训练的情况下,在 Charades-STA 和 ActivityNet Captions 数据集上实现了零样本视频时序 grounding 的最佳性能,并在跨数据集和 OOD 设置下表现出更好的泛化能力。

关键词

引用

@article{arxiv.2408.16219,
  title  = {Training-free Video Temporal Grounding using Large-scale Pre-trained Models},
  author = {Minghang Zheng and Xinhao Cai and Qingchao Chen and Yuxin Peng and Yang Liu},
  journal= {arXiv preprint arXiv:2408.16219},
  year   = {2024}
}

备注

Accepted by ECCV 2024