中文

DreamLite: 一个用于图像生成与编辑的轻量级端侧统一模型

计算机视觉与模式识别 2026-03-31 v1

摘要

扩散模型在文本到图像(T2I)生成和文本引导图像编辑方面取得了显著进展。然而,这些模型通常包含数十亿参数,导致高延迟和部署挑战。虽然端侧扩散模型提高了效率,但它们主要聚焦于T2I生成,缺乏图像编辑的支持。在本文中,我们提出了DreamLite,一个紧凑的端侧统一扩散模型(0.39B),在单一网络中同时支持T2I生成和文本引导图像编辑。DreamLite基于剪枝后的移动端U-Net骨干网络构建,通过在潜在空间中的上下文空间拼接实现统一条件化。它将图像水平拼接作为输入,生成任务采用(目标 | 空白)配置,编辑任务采用(目标 | 源)配置。为稳定该紧凑模型的训练,我们引入了一种任务渐进式联合预训练策略,依次针对T2I、编辑和联合任务。经过高质量SFT和强化学习后,DreamLite在图像生成上达到GenEval(0.72),在图像编辑上达到ImgEdit(4.11),优于现有端侧模型,并与多个服务端模型保持竞争力。通过采用步骤蒸馏,我们进一步将去噪处理减少到仅4步,使DreamLite能够在小米14智能手机上不到1秒内生成或编辑1024×1024图像。据我们所知,DreamLite是首个同时支持图像生成与图像编辑的端侧统一扩散模型。

关键词

引用

@article{arxiv.2603.28713,
  title  = {DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing},
  author = {Kailai Feng and Yuxiang Wei and Bo Chen and Yang Pan and Hu Ye and Songwei Liu and Chenqian Yan and Yuan Gao},
  journal= {arXiv preprint arXiv:2603.28713},
  year   = {2026}
}

备注

https://carlofkl.github.io/dreamlite/