中文

视觉基础模型作为图像生成的通用分词器

计算机视觉与模式识别 2026-05-19 v1

摘要

在本工作中,我们探索了一个很大程度上未被探索的方向,即在冻结的视觉基础模型(VFM)之上直接构建通用图像分词器。为了构建该分词器,我们利用冻结的 VFM 作为编码器,并引入了两项关键创新:(1)一个区域自适应量化框架,以消除标准 2D 网格特征中的空间冗余;以及(2)一个语义重建目标,将解码输出与 VFM 的表示对齐以保持语义保真度。基于这些设计,我们提出了 VFMTok,一种能够在离散和连续潜在空间中无缝操作的通用视觉分词器。VFMTok 在合成质量上取得了显著改善,同时大幅提高了 token 效率。对于离散自回归(AR)生成,它将模型收敛速度加快了 \textbf{3 倍},并在 ImageNet 类条件合成上实现了 \textbf{1.36} 的 SOTA gFID。类似地,对于连续空间生成,将 VFMTok 与去噪模型结合产生了 \textbf{1.25} 的卓越 gFID。此外,由于潜在空间本质上捕获了丰富的空间语义,VFMTok 在两种生成范式中均无需分类器自由引导(\textbf{w/o CFG})即可实现高保真类条件合成,显著加快了推理速度。除了这些显著的实证结果外,我们还系统地研究了我们方法的底层机制。我们发现,VFM 预训练期间使用的特定自监督学习目标决定了其作为分词器的有效性。具体而言,通过全局对比学习和潜在掩码图像建模联合优化的 VFM 为图像分词提供了最优表示。这些见解奠定了坚实的基础,并为未来图像分词器的设计提供了有价值的指导。

关键词

引用

@article{arxiv.2605.18390,
  title  = {Vision Foundation Models as Generalist Tokenizers for Image Generation},
  author = {Anlin Zheng and Qi Han and Xin Wen and Chuofan Ma and Lanxi Gong and Gang Yu and Xiangyu Zhang and Xiaojuan Qi},
  journal= {arXiv preprint arXiv:2605.18390},
  year   = {2026}
}

备注

4 figures and 14 tables