ImageFolder:折叠标记的自回归图像生成
计算机视觉与模式识别
2024-12-05 v3
摘要
图像标记器是视觉生成模型(如扩散模型和自回归模型)至关重要的组件,因为它们构建了用于建模的潜在表示。增加标记长度是提高图像重构质量的常见方法。然而,标记长度更长的标记器并不一定实现更好的生成质量。在生成和重构质量之间存在关于标记长度的权衡。本文研究了标记长度对图像重构和生成的影响,并提供了一种灵活的解决方案以解决该权衡。我们提出了 ImageFolder,一种语义标记器,提供可在自回归建模期间折叠的空间对齐图像标记,以提高生成效率和质量。为增强而不增加标记长度的表征能力,我们利用双分支产品量化来捕获图像的不同上下文。具体而言,在一个分支中引入语义正则化以鼓励紧凑的语义信息,而另一个分支则设计用于捕获剩余的像素级细节。广泛的实验表明,ImageFolder 标记器在图像生成质量方面优于现有方法,同时实现了更短的标记长度。
引用
@article{arxiv.2410.01756,
title = {ImageFolder: Autoregressive Image Generation with Folded Tokens},
author = {Xiang Li and Kai Qiu and Hao Chen and Jason Kuen and Jiuxiang Gu and Bhiksha Raj and Zhe Lin},
journal= {arXiv preprint arXiv:2410.01756},
year = {2024}
}
备注
Code: https://github.com/lxa9867/ImageFolder