DyPE:面向超高分辨率扩散模型的动态位置外推
计算机视觉与模式识别
2026-01-30 v2
摘要
扩散 Transformer 模型能够以卓越的保真度和细节生成图像,但由于自注意力机制随图像 token 数量的二次增长,训练超高分辨率模型代价极高。本文引入动态位置外推 (DyPE),一种新型无训练方法,使预训练的扩散 Transformer 能在无额外采样成本下生成远超训练数据分辨率的图像。DyPE 利用扩散过程中固有的谱进展,即低频结构早期收敛,而高频结构需更多步数才能解析。具体而言,DyPE 在每个扩散步骤动态调整模型的位置编码,将其频谱与生成过程的当前阶段匹配。该方法允许我们在分辨率远超训练分辨率的情况下生成图像,例如使用 FLUX 生成 1600 万像素图像。在多个基准测试中,DyPE 始终提升性能,在超高分辨率图像生成中实现最先进的保真度,提升在更高分辨率下更为显著。项目页面地址为 https://noamissachar.github.io/DyPE/。
关键词
引用
@article{arxiv.2510.20766,
title = {DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion},
author = {Noam Issachar and Guy Yariv and Sagie Benaim and Yossi Adi and Dani Lischinski and Raanan Fattal},
journal= {arXiv preprint arXiv:2510.20766},
year = {2026}
}