SnapFusion:两秒内移动端文本到图像扩散模型
计算机视觉与模式识别
2023-10-17 v3 人工智能
机器学习
摘要
文本到图像扩散模型能够从自然语言描述中创建媲美专业艺术家和摄影师的惊艳图像。然而,这些模型庞大,具有复杂的网络架构和数十次去噪迭代,导致计算昂贵且运行缓慢。因此,需要高端GPU和基于云的推理来大规模运行扩散模型。这成本高昂且具有隐私影响,尤其是当用户数据被发送给第三方时。为克服这些挑战,我们提出了一种通用方法,首次实现在不到秒内在移动设备上运行文本到图像扩散模型。我们通过引入高效网络架构和改进步数蒸馏来实现这一点。具体而言,我们通过识别原始模型的冗余性并经由数据蒸馏降低图像解码器的计算量,提出了一种高效的UNet。此外,我们通过探索训练策略并引入来自无分类器引导的正则化来增强步数蒸馏。我们在MS-COCO上的大量实验表明,我们具有步去噪的模型取得了优于具有步的Stable Diffusion v的FID和CLIP分数。我们的工作通过将强大的文本到图像扩散模型带到用户手中,使内容创作民主化。
引用
@article{arxiv.2306.00980,
title = {SnapFusion: Text-to-Image Diffusion Model on Mobile Devices within Two Seconds},
author = {Yanyu Li and Huan Wang and Qing Jin and Ju Hu and Pavlo Chemerys and Yun Fu and Yanzhi Wang and Sergey Tulyakov and Jian Ren},
journal= {arXiv preprint arXiv:2306.00980},
year = {2023}
}
备注
Our project webpage: https://snap-research.github.io/SnapFusion/