中文

GigaTok:将视觉标记器扩展至 30 亿参数用于自回归图像生成

计算机视觉与模式识别 2025-08-26 v2

摘要

在自回归(AR)图像生成中,视觉标记器将图像压缩为紧凑的离散潜在标记,使下游自回归模型能够通过 next-token 预测高效地进行视觉生成。虽然扩大视觉标记器的规模会提高图像重建质量,但往往会损害下游生成质量——这一挑战在现有文献中尚未得到充分解决。为此,我们引入 GigaTok,这是首个能够同时提高图像重建、生成和表示学习的标记器扩展方法。我们识别出潜在空间复杂度增加是重建与生成困境的关键因素。为缓解这一问题,我们提出了语义正则化,这将标记器特征与来自预训练视觉编码器的语义一致特征对齐。这一约束防止了在扩展时潜在空间复杂度的过度增加,导致重建和下游自回归生成质量得到一致的提升。建立在语义正则化基础上,我们探索了扩大标记器规模的三项关键做法:(1) 使用 1D 标记器以获得更好的可扩展性;(2) 在扩充编码器和解码器时优先扩展解码器;(3) 采用熵损失以稳定 30 亿规模标记器的训练。通过扩展至 3 illion\bf{3 \space illion} 参数,GigaTok 在重建、下游 AR 生成和下游 AR 表示质量方面实现了最先进的性能。

关键词

引用

@article{arxiv.2504.08736,
  title  = {GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation},
  author = {Tianwei Xiong and Jun Hao Liew and Zilong Huang and Jiashi Feng and Xihui Liu},
  journal= {arXiv preprint arXiv:2504.08736},
  year   = {2025}
}

备注

ICCV 2025. Project page: https://silentview.github.io/GigaTok