中文

面向开放世界视频时间定位的大型数据集与训练范式 - OmniVTG

计算机视觉与模式识别 2026-04-29 v1

摘要

视频时间定位(VTG)是从文本查询中定位视频片段的任务,在开放世界环境中因数据规模有限和语义多样性不足而表现不佳,导致常见概念与稀有概念之间的性能差距。为克服这些限制,我们提出了面向开放世界 VTG 的大型数据集 OmniVTG,搭配面向增强时空定位能力的自我纠正链式思维(Self-Correction Chain-of-Thought,CoT)训练范式。我们的 OmniVTG 通过一种新颖的语义覆盖迭代扩编管道构建,首先识别现有数据集词汇中的空白,并收集可能包含这些目标概念的视频。为了获得高质量的标注,我们利用现代 LMM 在密集描述方面优于直接定位的洞见,设计了面向 LMM 的描述导向数据引擎,以生成带时间戳的密集描述。除了数据集之外,我们发现简单的监督微调(SFT)仍不够,因为稀有概念与常见概念之间的性能差距仍然存在。我们发现 LMM 的视频理解能力显著优于其直接时空定位能力。基于此,我们提出了自我纠正链式思维(CoT)训练范式。我们通过三阶段管道(SFT、CoT 微调和强化学习)训练 LMM 首先预测,然后利用其理解能力对自身预测进行反思和 refinement。广泛的实验表明,我们的方法不仅在 OmniVTG 数据集上在开放世界时空定位方面卓越,而且在四个现有 VTG 数据集上实现了最先进的零样本性能。代码已公开于 https://github.com/oceanflowlab/OmniVTG。

关键词

引用

@article{arxiv.2604.25276,
  title  = {OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding},
  author = {Minghang Zheng and Zihao Yin and Yi Yang and Yuxin Peng and Yang Liu},
  journal= {arXiv preprint arXiv:2604.25276},
  year   = {2026}
}

备注

CVPR 2026