SnapGen:通过高效架构与训练驯服移动设备上的高分辨率文本到图像模型
计算机视觉与模式识别
2024-12-13 v1
摘要
现有的文本到图像扩散模型面临模型体积大、运行缓慢以及在移动设备上生成质量低等多重局限。本文旨在开发一个极小且快速的文本到图像模型,在移动平台上生成高分辨率和高质量图像。我们提出了多项技术以实现此目标。首先,系统性地检查网络架构的设计选择,以减少模型参数和延迟,同时确保高质量生成。其次,为进一步提升生成质量,我们采用跨架构知识蒸馏,从更大模型进行多层次指导式训练。再者,通过对抗引导与知识蒸馏相结合,实现少步生成。我们首次将SnapGen模型展示,在移动设备上约1.4秒即可生成1024×1024像素图像。在ImageNet-1K上,我们的模型仅含372M参数,实现了256×256像素生成的FID为2.06。在文本到图像基准测试(如GenEval和DPG-Bench)上,参数仅379M的模型,已超越数十亿参数的大规模模型(例如,比SDXL小7倍,比IF-XL小14倍)。
引用
@article{arxiv.2412.09619,
title = {SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and Training},
author = {Dongting Hu and Jierun Chen and Xijie Huang and Huseyin Coskun and Arpit Sahni and Aarush Gupta and Anujraaj Goyal and Dishani Lahiri and Rajesh Singh and Yerlan Idelbayev and Junli Cao and Yanyu Li and Kwang-Ting Cheng and S. -H. Gary Chan and Mingming Gong and Sergey Tulyakov and Anil Kag and Yanwu Xu and Jian Ren},
journal= {arXiv preprint arXiv:2412.09619},
year = {2024}
}