VFM-VAE:视觉基础模型可作为潜在扩散模型的优质标记器
计算机视觉与模式识别
2026-04-24 v3 机器学习
摘要
潜在扩散模型 (LDMs) 的性能严重依赖其视觉标记器的质量。虽然最近的研究探索了通过蒸馏将视觉基础模型 (VFM) 纳入标记器训练,但我们通过实证发现,这种方法不可避免地削弱了从原始 VFM 学习到的表示的鲁棒性。本文提出一种更直接的方法,利用冻结的 VFM 作为 LDMs 的标记器,称为 VFM 变分自编码器 (VFM-VAE)。为充分发挥利用冻结 VFM 作为标记器的潜力,我们设计了新的解码器,以从 VFM 的语义丰富表示中重建真实图像。通过提出的 VFM-VAE,我们进行了系统性研究,探讨了不同标记器表示对扩散训练过程中表示学习的影响,实现了标记器和扩散模型双方对齐的协同效应。我们的标记器设计和训练策略实现了卓越的性能与效率:本系统仅用 80 个 epoch 即可达到 gFID (无 CFG) 为 2.22(比先前标记器快 10 倍),在继续训练至 640 个 epoch 后,进一步达到 gFID (无 CFG) 为 1.62。这些结果为 VFM 作为视觉标记器加速 LDM 训练进程提供了坚实的证据。
引用
@article{arxiv.2510.18457,
title = {VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models},
author = {Tianci Bi and Xiaoyi Zhang and Yan Lu and Nanning Zheng},
journal= {arXiv preprint arXiv:2510.18457},
year = {2026}
}
备注
Accepted at CVPR 2026. Code and models available at: https://github.com/tianciB/VFM-VAE