中文

HiDiffusion:在预训练扩散模型中释放更高分辨率的创造力与效率

计算机视觉与模式识别 2024-04-30 v2

摘要

扩散模型已成为高分辨率图像合成的主流方法。然而,直接从预训练扩散模型生成更高分辨率图像会遇到不合理的物体复制问题,并使生成时间呈指数增长。在本文中,我们发现物体复制源于 U-Net 深层中的特征复制。同时,我们将生成时间延长归因于 U-Net 顶层中的自注意力冗余。为解决这些问题,我们提出了一种名为 HiDiffusion 的免调参高分辨率框架。具体而言,HiDiffusion 包含分辨率感知 U-Net(RAU-Net),其动态调整特征图大小以解决物体复制问题,并采用改进移位窗口多头自注意力(MSW-MSA),利用优化后的窗口注意力减少计算量。我们可以将 HiDiffusion 集成到各种预训练扩散模型中,将图像生成分辨率扩展至 4096x4096,推理速度为先前方法的 1.5-6 倍。大量实验表明,我们的方法能够解决物体复制与计算繁重的问题,在更高分辨率图像合成任务上取得了最先进的性能。

关键词

引用

@article{arxiv.2311.17528,
  title  = {HiDiffusion: Unlocking Higher-Resolution Creativity and Efficiency in Pretrained Diffusion Models},
  author = {Shen Zhang and Zhaowei Chen and Zhenyu Zhao and Yuhao Chen and Yao Tang and Jiajun Liang},
  journal= {arXiv preprint arXiv:2311.17528},
  year   = {2024}
}