DINO-Tok:将 DINO 适用于视觉标记器
计算机视觉与模式识别
2026-03-25 v2
摘要
近期视觉生成技术的进展强调了潜在生成模型(Latent Generative Models, LGMs)的重要性,这些模型严重依赖有效的视觉标记器以桥接像素与语义表示。然而,基于预训练视觉基础模型(Vision Foundation Models, VFMs)构建的标记器往往难以在高维潜在空间中平衡语义丰富性与重建保真度。在本文中,我们引入 DINO-Tok,一种基于冻结 DINO 编码器的视觉标记器,支持连续自动编码(DINO-Tok-AE)和离散向量量化(DINO-Tok-VQ)。通过将来自浅层细粒度特征与深层全局语义的层次表示统一到信息完整的潜在空间中,DINO-Tok 在保持纹理细节的同时维持语义一致性,以利于生成。我们进一步探讨了在高维冻结语义特征空间中的离散 VQ,其中容易出现信息稀释和码本坍缩。为解决此问题,我们提出支配子空间量化(Dominant-Subspace Quantization, DSQ),其利用全局 PCA 分析选择主成分,同时抑制噪声维度,从而稳定码本优化并提升重建和生成质量。在 ImageNet 256x256 上,DINO-Tok 实现了强劲的重建性能,连续自动编码达到 0.28 rFID,离散 VQ 达到 1.10 rFID,同时在扩散模型上实现 1.82 gFID,在自回归生成上实现 2.44 gFID。这些结果表明,预训练 VFMs 如 DINO 可直接适用于面向下一代潜在生成模型的高保真、语义对齐视觉标记器。代码将在 https://github.com/MKJia/DINO-Tok 上公开。
引用
@article{arxiv.2511.20565,
title = {DINO-Tok: Adapting DINO for Visual Tokenizers},
author = {Mingkai Jia and Mingxiao Li and Zhijian Shu and Anlin Zheng and Liaoyuan Fan and Jiaxin Guo and Tianxing Shi and Dongyue Lu and Zeming Li and Xiaoyang Guo and Xiaojuan Qi and Xiao-Xiao Long and Qian Zhang and Ping Tan and Wei Yin},
journal= {arXiv preprint arXiv:2511.20565},
year = {2026}
}