中文

VLog:基于生成检索的视频语言模型

计算机视觉与模式识别 2025-06-10 v2

摘要

人类的日常活动可以简洁地描述为视频流中一系列常规事件的序列(例如,关闭闹铃),形成事件词汇表。基于此,我们引入VLog,一种新的视频理解框架,将视频叙述定义为词汇表,超越现有生成式视频语言模型中通常的子词词汇表。基于轻量级语言模型GPT-2构建的VLog具有三个关键创新:(i)一种生成检索模型,将语言模型的复杂推理能力与对叙述词汇表的灵活升级相结合;(ii)基于大规模视频叙述构建的层次化词汇表,通过我们的叙述对编码算法实现,对特定事件(例如,切tomato)的高效索引,通过识别更广泛的情景(例如,厨房)以及富有表现力的后缀(例如,靠左手)来实现。(iii)一种词汇更新策略,利用生成模型扩展遇到新事件时检测到的词汇表。为验证我们的方法的有效性,我们引入VidCap-Eval,一个要求简洁叙述并包含推理关系(例如,在前后)的开发集。EgoSchema、COIN和HiREST上的实验进一步证明了VLog的有效性,突出了其能够生成简洁、情境准确且高效叙述的能力,为视频理解提供了新的视角。代码已发布于 https://github.com/showlab/VLog。

关键词

引用

@article{arxiv.2503.09402,
  title  = {VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary},
  author = {Kevin Qinghong Lin and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2503.09402},
  year   = {2025}
}

备注

Accepted by CVPR 2025. Github: https://github.com/showlab/VLog