中文

MobileDiffusion:移动设备上的即时文本到图像生成

计算机视觉与模式识别 2024-06-13 v2

摘要

大规模文本到图像扩散模型在移动设备上的部署受其庞大模型尺寸与缓慢推理速度的阻碍。本文中,我们提出 \textbf{MobileDiffusion},一种通过架构与采样技术的广泛优化而获得的高效文本到图像扩散模型。我们对模型架构设计进行了全面考察,以减少冗余、提升计算效率并最小化模型参数量,同时保持图像生成质量。此外,我们对 MobileDiffusion 采用蒸馏与 diffusion-GAN 微调技术,分别实现 8 步与 1 步推理。定量与定性开展的实证研究表明了我们提出技术的有效性。MobileDiffusion 在移动设备上生成 512×512512\times512 图像实现了卓越的 \textbf{亚秒级} 推理速度,确立了新的 state of the art。

关键词

引用

@article{arxiv.2311.16567,
  title  = {MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices},
  author = {Yang Zhao and Yanwu Xu and Zhisheng Xiao and Haolin Jia and Tingbo Hou},
  journal= {arXiv preprint arXiv:2311.16567},
  year   = {2024}
}