OmniTokenizer:面向图像与视频生成的统一图像-视频 Tokenizer
计算机视觉与模式识别
2024-06-14 v1
摘要
Tokenizer 作为将复杂视觉数据映射到紧凑潜在空间的翻译器,是视觉生成模型的核心。基于现有 Tokenizer 仅针对图像或视频输入进行优化的发现,本文提出 OmniTokenizer——一个基于 Transformer 的联合图像-视频 Tokenizer。OmniTokenizer 采用空间-时间解耦架构,集成窗口注意力和因果注意力用于空间和时间建模。为充分发挥图像与视频数据数据的互补性,本文进一步提出渐进式训练策略:首先在固定分辨率下仅使用图像数据训练,以develop空间编码能力;随后在多分辨率下联合图像和视频数据训练,以学习时间动态。OmniTokenizer 首次在统一框架内处理图像和视频输入,证明了两者协同可能性。大量实验表明,OmniTokenizer 在多种图像和视频数据集上实现了最先进(SOTA)的重建性能,例如在 ImageNet 上的 1.11 分重建 FID,在 UCF-101 上的 42 分重建 FVD,分别比前人 SOTA 方法提升了 13% 和 26%。此外,我们还展示在集成 OmniTokenizer 时,基于语言模型的方法和扩散模型都能实现更优的视觉合成性能,凸显了该方法的优越性与通用性。代码已公开于 https://github.com/FoundationVision/OmniTokenizer。
引用
@article{arxiv.2406.09399,
title = {OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation},
author = {Junke Wang and Yi Jiang and Zehuan Yuan and Binyue Peng and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2406.09399},
year = {2024}
}