中文

Divot:基于扩散的视频 tokenizer 用于理解与生成

计算机视觉与模式识别 2024-12-06 v1

摘要

近年来,人们对将图像理解与生成统一到大语言模型(LLM)中的兴趣显著激增。这一兴趣的增长促使我们探索将这种统一扩展到视频领域。核心挑战在于开发一种通用的视频 tokenizer,既能捕获视频的空间特征,又能捕获视频的时序动态,从而为 LLM 提供表示,并能进一步解码为真实的视频片段以实现视频生成。在本工作中,我们引入了 Divot,这是一种基于扩散的视频 tokenizer,利用扩散过程进行自监督视频表示学习。我们认为,如果视频扩散模型能够通过将视频 tokenizer 的特征作为条件来有效去噪视频片段,那么 tokenizer 就已成功捕获了鲁棒的空间和时序信息。此外,视频扩散模型本身天然地作为去词器,能够从其表示中解码视频。基于 Divot tokenizer,我们通过对 Divot 特征的连续值分布建模为高斯混合模型,提出了 Divot-Vicuna,通过视频到文本自回归和文本到视频生成。实验结果表明,我们的基于扩散的视频 tokenizer 在与预训练 LLM 集成后,在各种视频理解和生成基准测试中实现了竞争性的性能。经指令调优的 Divot-Vicuna 在视频叙事方面也表现出色,能够生成交错的叙事内容和相应的视频。

关键词

引用

@article{arxiv.2412.04432,
  title  = {Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation},
  author = {Yuying Ge and Yizhuo Li and Yixiao Ge and Ying Shan},
  journal= {arXiv preprint arXiv:2412.04432},
  year   = {2024}
}

备注

Project released at: https://github.com/TencentARC/Divot