SwiftBrush: 基于变分分数蒸馏的一步文本到图像扩散模型
计算机视觉与模式识别
2024-11-19 v7
摘要
尽管文本到图像扩散模型能够从文本提示生成高分辨率且多样化的图像,但它们通常受限于缓慢的迭代采样过程。模型蒸馏是加速这些模型的最有效方向之一。然而,先前的蒸馏方法在保留生成质量方面失败,同时需要大量图像进行训练,这些图像要么来自真实数据,要么由教师模型合成生成。针对这一限制,我们提出了一种新颖的无图像蒸馏方案,名为 。受文本到 3D 合成的启发——其中可以通过一个专门的损失函数从 2D 文本到图像扩散先验中获得与输入提示对齐的 3D 神经辐射场,而无需任何 3D 数据真值——我们的方法重新利用相同的损失函数,将预训练的多步文本到图像模型蒸馏到一个学生网络,该网络仅需单步推理即可生成高保真图像。尽管方法简单,我们的模型是首批无需依赖任何训练图像数据即可生成与 Stable Diffusion 质量相当图像的一步文本到图像生成器之一。值得注意的是,SwiftBrush 在 COCO-30K 基准上取得了 的 FID 分数和 的 CLIP 分数,达到了具有竞争力的结果,甚至大幅超越了现有的最先进蒸馏技术。
引用
@article{arxiv.2312.05239,
title = {SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score Distillation},
author = {Thuan Hoang Nguyen and Anh Tran},
journal= {arXiv preprint arXiv:2312.05239},
year = {2024}
}
备注
Accepted to CVPR 2024; Github: https://github.com/VinAIResearch/SwiftBrush