中文

利用潜在一致性匹配扩散改进向量量化图像建模

机器学习 2025-04-02 v2

摘要

通过将离散表示嵌入到连续潜在空间中,我们可以利用连续空间潜在扩散模型来处理离散数据的生成建模。然而,尽管取得了初步成功,大多数潜在扩散方法依赖于固定的预训练嵌入,限制了与扩散模型联合训练的好处。虽然联合学习嵌入(通过重构损失)和潜在扩散模型(通过分数匹配损失)可以提升性能,但端到端训练存在嵌入坍缩的风险,从而降低生成质量。为了缓解这个问题,我们引入了 VQ-LCMD,一种在嵌入空间内稳定训练的连续空间潜在扩散框架。VQ-LCMD 使用一种新颖的训练目标,该目标结合了联合嵌入-扩散变分下界与一致性匹配(CM)损失,以及一个偏移的余弦噪声调度和随机丢弃策略。在多个基准上的实验表明,与离散状态潜在扩散模型相比,所提出的 VQ-LCMD 在 FFHQ、LSUN Churches 和 LSUN Bedrooms 上取得了更优的结果。特别是,VQ-LCMD 在 ImageNet 上使用 50 步进行类别条件图像生成时,达到了 6.81 的 FID。

关键词

引用

@article{arxiv.2410.14758,
  title  = {Improving Vector-Quantized Image Modeling with Latent Consistency-Matching Diffusion},
  author = {Bac Nguyen and Chieh-Hsin Lai and Yuhta Takida and Naoki Murata and Toshimitsu Uesaka and Stefano Ermon and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2410.14758},
  year   = {2025}
}