中文

VideoFlexTok:灵活长度的由粗到精视频分词

计算机视觉与模式识别 2026-04-15 v1 机器学习

摘要

视觉分词器将高维原始像素映射为用于下游建模的压缩表示。除了压缩之外,分词器还决定了哪些信息被保留以及如何组织。一种事实上的标准视频分词方法是将视频表示为时空 3D 网格的标记,每个标记捕获原始信号中相应的局部信息。这要求消费这些标记的下游模型(例如,文本到视频模型)学习“逐像素”预测所有低级细节,而不管视频的固有复杂性如何,导致学习复杂度高。我们提出了 VideoFlexTok,它用可变长度的标记序列表示视频,这些标记以由粗到精的方式组织——其中前几个标记(涌现地)捕获抽象信息,如语义和运动,而后面的标记则添加细粒度细节。生成式流解码器能够从任意数量的标记中实现逼真的视频重建。这种表示结构允许根据下游需求调整标记数量,并在相同预算下编码比基线更长的视频。我们在类别条件和文本到视频生成任务上评估了 VideoFlexTok,并表明与 3D 网格标记相比,它带来了更高效的训练,例如,在实现相当的生成质量(gFVD 和 ViCLIP 分数)的同时,模型大小缩小了 5 倍(1.1B 对比 5.2B)。最后,我们展示了 VideoFlexTok 如何通过仅使用 672 个标记(比可比的 3D 网格分词器少 8 倍)训练一个 10 秒 81 帧视频的文本到视频模型,来实现长视频生成而无需高昂的计算成本。

关键词

引用

@article{arxiv.2604.12887,
  title  = {VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization},
  author = {Andrei Atanov and Jesse Allardice and Roman Bachmann and Oğuzhan Fatih Kar and R Devon Hjelm and David Griffiths and Peter Fu and Afshin Dehghan and Amir Zamir},
  journal= {arXiv preprint arXiv:2604.12887},
  year   = {2026}
}

备注

project page at https://videoflextok.epfl.ch/