单程票:用于蒸馏文本到图像扩散模型的时间无关统一编码器
计算机视觉与模式识别
2025-05-29 v1
摘要
文本到图像(T2I)扩散模型在生成建模方面取得了显著进展;然而,它们在推理速度和图像质量之间面临权衡,给高效部署带来了挑战。现有的蒸馏 T2I 模型可以用更少的采样步数生成高保真图像,但往往在多样性和质量上存在困难,尤其是在单步模型中。从我们的分析中,我们观察到 UNet 编码器中存在冗余计算。我们的研究结果表明,对于 T2I 扩散模型,解码器更擅长捕获更丰富、更明确的语义信息,而编码器可以在来自不同时间步的解码器之间有效共享。基于这些观察,我们为学生模型 UNet 架构引入了首个时间无关统一编码器 TiUE,这是一种用于蒸馏 T2I 模型的无循环图像生成方法。采用单次传递方案,TiUE 在多个解码器时间步之间共享编码器特征,实现了并行采样并显著降低了推理时间复杂度。此外,我们引入了 KL 散度项来正则化噪声预测,从而增强了生成图像的感知真实性和多样性。实验结果表明,TiUE 优于包括 LCM、SD-Turbo 和 SwiftBrushv2 在内的最先进方法,在保持计算效率的同时产生了更多样和逼真的结果。
引用
@article{arxiv.2505.21960,
title = {One-Way Ticket:Time-Independent Unified Encoder for Distilling Text-to-Image Diffusion Models},
author = {Senmao Li and Lei Wang and Kai Wang and Tao Liu and Jiehang Xie and Joost van de Weijer and Fahad Shahbaz Khan and Shiqi Yang and Yaxing Wang and Jian Yang},
journal= {arXiv preprint arXiv:2505.21960},
year = {2025}
}
备注
Accepted at CVPR2025, Code: https://github.com/sen-mao/Loopfree