中文

面向自回归图像生成的1D视觉标记器:学习层次残差-ResTok

计算机视觉与模式识别 2026-01-08 v1

摘要

现有的1D视觉标记器用于自回归(AR)生成主要遵循语言建模的设计原则,由于基于变压器构建,其先验来源于语言,导致单层次潜在标记且将视觉数据视为平坦序列标记流。这一语言化的表述忽略了视觉的关键属性,特别是层次和残差网络设计,这些设计长期以来对于视觉模型的收敛和效率至关重要。为了让“视觉”重新回归视觉,我们提出了残差标记器(ResTok),一种1D视觉标记器,通过为图像标记和潜在标记构建层次残差来实现层次化。通过逐层合并获得的层次表示使每一层都能够进行跨层特征融合,大大增强了表征能力。同时,层次之间的语义残差可防止信息重叠,导致更集中分布的潜在表示,更适合AR建模。跨层绑定随之自然出现,无需额外约束。为了加速生成过程,我们进一步引入了层次AR生成器,通过一次性预测整个潜在标记层级,而非严格逐个标记生成,从而大幅减少采样步骤。大量实验表明,在视觉标记化中恢复层次残差先验显著性地改进了AR图像生成,在仅9个采样步骤的情况下即可实现ImageNet-256的gFID 2.34。代码已公开:https://github.com/Kwai-Kolors/ResTok。

关键词

引用

@article{arxiv.2601.03955,
  title  = {ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation},
  author = {Xu Zhang and Cheng Da and Huan Yang and Kun Gai and Ming Lu and Zhan Ma},
  journal= {arXiv preprint arXiv:2601.03955},
  year   = {2026}
}

备注

Technical report