中文

VTok:一种解耦空间-时间潜在的统一视频标记器

计算机视觉与模式识别 2026-02-05 v1

摘要

本工作提出VTok,一种可用于生成和理解任务的统一视频标记框架。不同于领先的视觉语言系统通过简单帧采样策略对视频进行标记,我们提出通过保留单帧关键帧的空间特征,同时将每个后续帧编码为单个残差标记,实现空间和时间表示的解耦,从而实现紧凑而富有表现力的视频标记。我们的实验表明,VTok有效地将视频表示的复杂度从帧数与每帧标记数之积降低到它们的和,同时残差标记足够捕获相对于关键帧的视点和运动变化。广泛的评估表明VTok在多个视频理解和文本到视频生成基准上均实现了显著的性能提升,同时每个视频的标记序列更短(例如,在我们的TV-Align基准上准确率提高3.4%,VBench得分提高1.9%)。值得注意的是,由于其更一致的时序编码,VTok在文本到视频生成中产生更连贯的运动并提供更强的跟随指导。我们希望VTok可以作为未来研究在视频理解和生成中的标准化视频标记范式。

关键词

引用

@article{arxiv.2602.04202,
  title  = {VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents},
  author = {Feng Wang and Yichun Shi and Ceyuan Yang and Qiushan Guo and Jingxiang Sun and Alan Yuille and Peng Wang},
  journal= {arXiv preprint arXiv:2602.04202},
  year   = {2026}
}