中文

DICE:将无分类器引导蒸馏到文本嵌入中

计算机视觉与模式识别 2025-11-25 v2

摘要

文本到图像扩散模型能够生成高质量图像,但次优的预训练文本表示常导致生成的图像未能与给定的文本提示保持良好对齐。无分类器引导 (CFG) 是一种流行且有效的技术,用于提高文本-图像对齐度,但 CFG 引入了显著的计算开销。本文提出了 DIstilling CFG by sharpening text Embeddings (DICE),该方法在采样过程中取代 CFG,计算复杂度减半,同时保持类似的生成质量。DICE 通过细化文本嵌入来复制 CFG 引导方向,将 CFG 基于的文本到图像扩散模型蒸馏为无 CFG 版本。如此可避免 CFG 的计算缺陷,在快速采样速度下实现高质量、与文本高度对齐的图像生成。进一步地,通过检查增强模式,我们识别了 DICE 如何锐化文本嵌入的特定组件以保留语义信息同时增强细粒度细节的底层机制。在多个 Stable Diffusion v1.5 变体、SDXL 和 PixArt-α\alpha 上进行了广泛实验,证明了该方法的有效性。代码地址:https://github.com/zju-pi/dice。

关键词

引用

@article{arxiv.2502.03726,
  title  = {DICE: Distilling Classifier-Free Guidance into Text Embeddings},
  author = {Zhenyu Zhou and Defang Chen and Can Wang and Chun Chen and Siwei Lyu},
  journal= {arXiv preprint arXiv:2502.03726},
  year   = {2025}
}

备注

AAAI 2026 (Oral)