中文

图像价值32个token用于重建和生成

计算机视觉与模式识别 2024-06-12 v1

摘要

最近的生成模型进展突显了图像分词在高分辨率图像合成中的关键作用。分词将图像转换为潜在表示,相较于直接处理像素,减少了计算需求,增强了生成过程的有效性和效率。先前方法,如VQGAN,typically utilize 2D latent grids with fixed downsampling factors。然而,这些2D分词面临管理图像中固有冗余的挑战,其中相邻区域经常显示相似性。为克服这一问题,我们引入了Transformer-based 1-Dimensional Tokenizer(TiTok),一种 innovative approach将图像tokenize为1D潜在序列。TiTok提供更紧凑的潜在表示,相较于传统技术产生显著更高效和更有效的表示。例如,256 x 256 x 3的图像可减少到仅32个离散token,显著减少了来自先前方法的256或1024个token。尽管其紧凑性,TiTok仍实现了与最先进方法的竞争性能。具体而言,使用相同的generator framework,TiTok在ImageNet 256 x 256基准测试上达到了1.97 gFID,显著优于MaskGIT baseline的4.21。TiTok的优势在更高分辨率时甚至更加突出。在ImageNet 512 x 512基准测试中,TiTok不仅优于最先进的扩散模型DiT-XL/2(gFID 2.74 vs. 3.04),而且将图像token减少64倍,导致410倍更快的生成过程。我们最佳的变体可以显著超过DiT-XL/2(gFID 2.13 vs. 3.04),同时仍然以74倍更快的速度生成高质量样本。

关键词

引用

@article{arxiv.2406.07550,
  title  = {An Image is Worth 32 Tokens for Reconstruction and Generation},
  author = {Qihang Yu and Mark Weber and Xueqing Deng and Xiaohui Shen and Daniel Cremers and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2406.07550},
  year   = {2024}
}

备注

A compact 1D Image Tokenization method, leading to SOTA generation performance while being substantially faster. Project page at https://yucornetto.github.io/projects/titok.html