中文

HiTVideo:利用分层分词器增强基于自回归大语言模型的文本到视频生成

计算机视觉与模式识别 2025-03-17 v1 人工智能

摘要

由于视频数据跨越时间和空间维度所固有的复杂性,文本到视频生成提出了重大挑战。它在生成过程中引入了额外的冗余、突变以及语言与视觉 token 之间的域差距。应对这些挑战需要一个有效的视频分词器,该分词器能够在保留基本语义和时空信息的同时高效编码视频数据,作为文本与视觉之间的关键桥梁。受 VQ-VAE-2 中的观察和传统动画工作流的启发,我们提出了用于文本到视频生成的分层分词器方法 HiTVideo。它利用具有多层离散 token 框架的 3D 因果 VAE,将视频内容编码为分层结构的码本。较高层以更高的压缩率捕获语义信息,而较低层则关注细粒度的时空细节,在压缩效率与重建质量之间取得平衡。我们的方法能够高效编码更长的视频序列(例如 8 秒,64 帧),与基线分词器相比,每像素比特数(bpp)减少了约 70%,同时保持有竞争力的重建质量。我们探讨了压缩与重建之间的权衡,同时强调了高压缩语义 token 在文本到视频任务中的优势。HiTVideo 旨在解决现有视频分词器在文本到视频生成任务中的潜在局限性,追求更高的压缩比并简化语言引导下的 LLM 建模,为推进文本到视频生成提供了一个可扩展且有前景的框架。演示页面:https://ziqinzhou66.github.io/project/HiTVideo。

关键词

引用

@article{arxiv.2503.11513,
  title  = {HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models},
  author = {Ziqin Zhou and Yifan Yang and Yuqing Yang and Tianyu He and Houwen Peng and Kai Qiu and Qi Dai and Lili Qiu and Chong Luo and Lingqiao Liu},
  journal= {arXiv preprint arXiv:2503.11513},
  year   = {2025}
}