中文

SoftVQ-VAE:高效的一维连续分词器

计算机视觉与模式识别 2025-03-18 v3 人工智能 机器学习

摘要

具有高压缩比的高效图像分词仍然是训练生成模型的一项关键挑战。我们提出了SoftVQ-VAE,一种连续图像分词器,它利用软分类后验将多个码字聚合到每个潜在token中,从而大幅提高潜在空间的表示能力。应用于基于Transformer的架构时,我们的方法仅使用少至32或64个一维token即可压缩256x256和512x512图像。SoftVQ-VAE不仅表现出一致且高质量的重建,更重要的是,它在不同的基于去噪的生成模型中实现了SOTA且显著更快的图像生成结果。值得注意的是,SoftVQ-VAE将生成256x256图像的推理吞吐量提高了多达18倍,将512x512图像提高了55倍,同时为SiT-XL实现了1.78和2.21的具竞争力的FID分数。它还通过将训练迭代次数减少2.3倍来提高生成模型的训练效率,同时保持相当的性能。凭借其完全可微的设计和语义丰富的潜在空间,我们的实验表明SoftVQ-VAE在不牺牲生成质量的情况下实现了高效分词,为更高效的生成模型铺平了道路。代码和模型已发布。

关键词

引用

@article{arxiv.2412.10958,
  title  = {SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer},
  author = {Hao Chen and Ze Wang and Xiang Li and Ximeng Sun and Fangyi Chen and Jiang Liu and Jindong Wang and Bhiksha Raj and Zicheng Liu and Emad Barsoum},
  journal= {arXiv preprint arXiv:2412.10958},
  year   = {2025}
}

备注

Code and model: https://github.com/Hhhhhhao/continuous_tokenizer