中文

EVATok:用于高效视觉自回归生成的自适应长度视频分词

计算机视觉与模式识别 2026-03-13 v1

摘要

自回归(AR)视频生成模型依赖视频分词器将像素压缩为离散 token 序列。这些 token 序列的长度对于在重构质量与下游生成计算成本之间取得平衡至关重要。传统视频分词器在不同时段的视频上应用统一的 token 分配,常常在简单、静态或重复的片段上浪费 token,而在动态或复杂片段上则不足。为解决这种效率问题,我们引入了 EVATok\textbf{EVATok},即 E\textbf{E}fficient V\textbf{V}ideo A\textbf{A}daptive Tok\textbf{Tok}enizers 框架。我们的框架为每个视频估算最优 token 分配,以实现最佳质量-成本权衡,开发轻量级路由器以快速预测这些最优分配,并训练基于路由器预测的自适应分词器进行视频编码。我们展示了 EVATok 在视频重构和下游 AR 生成方面在效率和整体质量方面取得了显著的改进。通过集成视频语义编码器的高级训练配方,EVATok 在 UCF-101 上实现了卓越的重构效果和引领性的类-视频生成,平均 token 使用量比 prior state-of-the-art LARP 及我们的固定长度基线至少节省 24.4%。

关键词

引用

@article{arxiv.2603.12267,
  title  = {EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation},
  author = {Tianwei Xiong and Jun Hao Liew and Zilong Huang and Zhijie Lin and Jiashi Feng and Xihui Liu},
  journal= {arXiv preprint arXiv:2603.12267},
  year   = {2026}
}

备注

Accepted by CVPR 2026. Project page: https://silentview.github.io/EVATok/