NoiseShift:面向低分辨率图像生成的分辨率感知噪声重校准
计算机视觉与模式识别
2026-05-18 v2 人工智能
摘要
文本到图像扩散模型在采样分辨率偏离最终训练分辨率集时通常会退化。先前的研究主要关注高分辨率生成,使预训练的扩散模型能够外推到训练期间未见过的分辨率。在本工作中,我们转而针对低分辨率生成,在降低的分辨率下进行推理以显著降低计算成本。我们证明,网络对噪声水平 conditioning 引入了一种训练-测试不匹配,直接损害低分辨率生成:相同的调度噪声水平在较低分辨率下可能对应不同的感知退化程度,从而错误校准了去噪器时间步和噪声嵌入。为此,我们提出NoiseShift,一种无需训练的重新校准方法,保持原始噪声采样调度不变,转而重新索引去噪器的噪声conditioning以恢复局部前向-反向一致性。通过在少量图像-文本对上使用轻量级的粗到细校准,NoiseShift学习从调度噪声到conditioning噪声的分辨率特定映射,减少训练-测试不匹配并改善低分辨率生成质量。将NoiseShift应用于Stable Diffusion 3(SD3)、Stable Diffusion 3.5(SD3.5)和Flux-Dev后,低分辨率下的生成质量持续改善。特别地,SD3在128×128分辨率下于LAION-COCO上的FID分数从203提升至171,SD3.5从310提升至277。即使已经实现了互补时间偏移策略的Flux-Dev也从NoiseShift中获得适度提升,在64×64分辨率下FID分数从120降至113。更重要的是,NoiseShift以最少的实现改动和零额外推理开销实现了这些提升。
引用
@article{arxiv.2510.02307,
title = {NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation},
author = {Ruozhen He and Moayed Haji-Ali and Ziyan Yang and Vicente Ordonez},
journal= {arXiv preprint arXiv:2510.02307},
year = {2026}
}