中文

探索扩散 U-Net 中的位置编码以实现免训练的高分辨率图像生成

计算机视觉与模式识别 2025-03-14 v1

摘要

通过预训练 U-Net 对更高分辨率的潜变量进行去噪会导致图像模式重复且杂乱。尽管最近的研究致力于通过在原始分辨率和更高分辨率之间对齐去噪过程来提高生成质量,但对次优生成的根本原因仍缺乏探索。通过对 U-Net 中位置编码的全面分析,我们将其归因于位置编码的不一致性,其根源在于随着分辨率增加,位置信息从零填充到卷积层中潜变量特征的传播不充分。为了解决这一问题,我们提出了一种新颖的免训练方法,引入了渐进式边界补全 (Progressive Boundary Complement, PBC) 方法。该方法在特征图内部创建动态虚拟图像边界,以增强位置信息的传播,从而实现高质量、内容丰富的高分辨率图像合成。大量实验证明了我们方法的优越性。

关键词

引用

@article{arxiv.2503.09830,
  title  = {Exploring Position Encoding in Diffusion U-Net for Training-free High-resolution Image Generation},
  author = {Feng Zhou and Pu Cao and Yiyang Ma and Lu Yang and Jianqin Yin},
  journal= {arXiv preprint arXiv:2503.09830},
  year   = {2025}
}

备注

Submitted to ICML 2025