中文

VTG-LLM:将时间戳知识集成到视频大语言模型中以提升视频时间定位

计算机视觉与模式识别 2025-02-04 v3

摘要

视频时间定位(Video Temporal Grounding,VTG)旨在使用语言查询准确定位特定视频中的事件时间戳,这对视频浏览和编辑等下游任务具有重要影响。不同于传统的任务特定模型,视频大语言模型(video LLMs)能够以零样本方式处理多个任务。因此,探索将视频大语言模型应用于VTG任务已成为日益活跃的研究领域。然而,尽管在视频内容理解方面取得了显著进展,视频大语言模型常常难以准确定位视频中的时间戳,这限制了其在VTG任务中的效能。为此,我们提出VTG-LLM,以增强视频大语言模型的时间戳定位能力。我们的方法包括:(1)有效地将时间戳知识集成到视觉标记中;(2)引入绝对时间标记,以无需概念位移的方式管理时间戳知识;(3)引入一种轻量级、高性能的基于槽位(slot-based)的标记压缩技术,以适应VTG任务大量采样帧的需求。此外,我们构建了VTG-IT-120K数据集集,重新标注以改善低质量标注。我们的实验结果表明,VTG-LLM在多种VTG任务上均优于其他视频大语言模型方法。

关键词

引用

@article{arxiv.2405.13382,
  title  = {VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding},
  author = {Yongxin Guo and Jingyu Liu and Mingda Li and Dingxin Cheng and Xiaoying Tang and Dianbo Sui and Qingbin Liu and Xi Chen and Kevin Zhao},
  journal= {arXiv preprint arXiv:2405.13382},
  year   = {2025}
}

备注

AAAI 2025