中文

改进灵活图像标记化器用于自回归图像生成

计算机视觉与模式识别 2026-01-06 v1

摘要

灵活图像标记化器旨在使用有序的1维可变长度标记序列表示图像。这种灵活的标记化通常通过嵌套 dropout 实现,即在训练期间随机截断一部分尾部标记,并通过剩余的前导序列重构图像。然而,这种尾部截断策略本质上将图像信息集中在早期标记中,限制了随着标记长度增加的下游自回归(AR)图像生成效果。为克服这些限制,我们提出了\textbf{ReToK},一种具有\underline{红\underline{多} \underline{标记}填充}和\underline{层次语义正则化}的灵活标记化器,旨在充分利用所有标记以增强潜在建模。具体而言,我们引入\textbf{冗余标记填充}以更频繁地激活尾部标记,从而缓解早期标记信息的过度集中。此外,我们应用\textbf{层次语义正则化}以将早期标记的解码特征与来自预训练视觉基础模型的特征对齐,同时逐渐减少正则化强度以允许更细致的低层次细节重构。广泛的实验表明,ReTok在ImageNet 256×256上实现了优于传统固定长度标记化器和灵活标记化器的卓越生成性能。代码将在: \href{https://github.com/zfu006/ReTok}{https://github.com/zfu006/ReTok}提供

关键词

引用

@article{arxiv.2601.01535,
  title  = {Improving Flexible Image Tokenizers for Autoregressive Image Generation},
  author = {Zixuan Fu and Lanqing Guo and Chong Wang and Binbin Song and Ding Liu and Bihan Wen},
  journal= {arXiv preprint arXiv:2601.01535},
  year   = {2026}
}