中文

从缩放视觉分词器用于重建与生成中获得的经验

计算机视觉与模式识别 2025-01-17 v1 人工智能

摘要

通过自编码进行视觉分词,将像素压缩到潜在空间中,赋能了最先进的图像和视频生成模型。尽管缩放基于 Transformer 的生成器是近期进展的核心,但分词器组件本身很少被缩放,留下了关于自编码器设计选择如何影响其重建目标及下游生成性能的未解问题。我们的工作旨在对自编码器中的缩放进行探索以填补这一空白。为了便于探索,我们用增强的用于分词的 Vision Transformer 架构替换了典型的卷积主干网络。我们在远超 ImageNet-1K 的大规模图像和视频数据集上训练 ViTok,消除了分词器缩放的数据限制。我们首先研究缩放自编码器瓶颈如何影响重建和生成,并发现虽然它与重建高度相关,但与生成的关系更为复杂。接着,我们探索了分别缩放自编码器的编码器和解码器对重建和生成性能的影响。关键发现是,缩放编码器对重建或生成的增益微乎其微,而缩放解码器能促进重建,但对生成的益处不一。基于我们的探索,我们将 ViTok 设计为轻量级自编码器,在 ImageNet-1K 和 COCO 重建任务(256p 和 512p)上取得了与最先进自编码器相当的性能,同时在 UCF-101 的 16 帧 128p 视频重建上优于现有自编码器,且 FLOPs 减少了 2-5 倍。当与 Diffusion Transformer 集成时,ViTok 在 ImageNet-1K 的图像生成上表现出竞争力,并在 UCF-101 的类条件视频生成上创下了新的最先进基准。

关键词

引用

@article{arxiv.2501.09755,
  title  = {Learnings from Scaling Visual Tokenizers for Reconstruction and Generation},
  author = {Philippe Hansen-Estruch and David Yan and Ching-Yao Chung and Orr Zohar and Jialiang Wang and Tingbo Hou and Tao Xu and Sriram Vishwanath and Peter Vajda and Xinlei Chen},
  journal= {arXiv preprint arXiv:2501.09755},
  year   = {2025}
}

备注

28 pages, 25 figures, 7 Tables