中文

PyraTok: 面向视频理解与生成的语言对齐金字塔分词器

计算机视觉与模式识别 2026-02-24 v2 人工智能

摘要

离散视频VAE是现代文本到视频生成和视频理解系统的基础,然而现有的分词器通常以单一尺度学习视觉码本,词汇量有限且语言监督较浅,导致跨模态对齐和零样本迁移性能较差。我们提出PyraTok,一种语言对齐的金字塔分词器,它在多个时空分辨率上学习语义结构化的离散潜在表示。PyraTok构建于预训练的视频VAE和一个新颖的语言对齐金字塔量化(LaPQ)模块之上,该模块使用共享的大规模二值码本对多个深度的编码器特征进行离散化,产生紧凑且富有表现力的视频令牌序列。为了紧密耦合视觉令牌与语言,PyraTok联合优化了多尺度文本引导的量化以及令牌层次结构上的全局自回归目标。在十个基准测试中,PyraTok实现了最先进的视频重建性能,持续改善了文本到视频的质量,并在视频分割、时序动作定位和视频理解方面创造了新的最先进零样本性能,可稳健扩展到高达4K/8K的分辨率。

关键词

引用

@article{arxiv.2601.16210,
  title  = {PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation},
  author = {Onkar Susladkar and Tushar Prakash and Adheesh Juvekar and Kiet A. Nguyen and Dong-Hwan Jang and Inderjit S Dhillon and Ismini Lourentzou},
  journal= {arXiv preprint arXiv:2601.16210},
  year   = {2026}
}