中文

InfoScale:通过有效利用信息释放无需训练的变尺度图像生成能力

计算机视觉与模式识别 2025-11-25 v3

摘要

扩散模型(DMs)在视觉生成领域已占据主导地位,但在训练分辨率不同的分辨率(无论是更低还是更高)上测试时性能会下降。事实上,生成变尺度图像的关键挑战在于不同分辨率之间存在差异化的信息量,这需要信息转换过程根据变尺度图像生成的需求进行调整。本文从三个关键方面对扩散模型在变尺度生成中的问题进行统一分析:膨胀卷积、注意力机制和初始噪声。具体而言,1)扩散模型中用于更高分辨率生成的膨胀卷积会丢失高频信息。2)用于变尺度图像生成的注意力机制难以自适应地调整信息聚合。3)初始噪声中的信息空间分布与变尺度图像不匹配。为解决上述问题,本文提出InfoScale,一个以信息为中心、通过三个方面有效利用信息的变尺度图像生成框架。对于1)中的信息损失,本文引入渐进频率补偿模块以补偿更高分辨率生成中由膨胀卷积丢失的高频信息。对于2)中的信息聚合不灵活性,本文引入自适应信息聚合模块以在低分辨率生成中自适应地聚合信息,并在高分辨率生成中实现局部信息与全局信息之间的有效平衡。对于3)中的信息分布不对齐,本文设计噪声适应模块以重新分配初始噪声中的信息用于变尺度生成。本文方法对扩散模型即插即用,大量实验证明了其在变尺度图像生成中的有效性。

关键词

引用

@article{arxiv.2509.01421,
  title  = {InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information},
  author = {Guohui Zhang and Jiangtong Tan and Linjiang Huang and Zhonghang Yuan and Mingde Yao and Jie Huang and Feng Zhao},
  journal= {arXiv preprint arXiv:2509.01421},
  year   = {2025}
}