通过随机位置编码提升扩散Transformer分辨率泛化能力
计算机视觉与模式识别
2026-01-08 v2
摘要
图像生成任务中的分辨率泛化能够以较低的训练分辨率生成更高分辨率图像。然而,扩散Transformer在解决此问题时面临位置编码在推理时与训练时不匹配的关键障碍。现有策略如位置编码插值、外推或混合方案未能完全解决此不匹配问题。本文提出一种二维随机位置编码RPE-2D,优先考虑图像块的排序而非绝对距离,实现无需在多分辨率上训练即可实现无缝的高低分辨率生成。具体而言,RPE-2D在训练时独立沿水平和垂直轴在扩张范围内采样位置,确保推理时使用的编码位于训练分布内,从而提升分辨率泛化。我们进一步引入简单的随机resize-and-crop数据增强以强化顺序建模,并添加微观条件指示所应用的裁剪模式。在ImageNet数据集上,RPE-2D在训练、和评估,以及训练、和评估时,实现了状态的最佳分辨率泛化性能,优于对手方法。RPE-2D在低分辨率图像生成、多阶段训练加速和多分辨率继承方面也表现出色。
引用
@article{arxiv.2503.18719,
title = {Boosting Resolution Generalization of Diffusion Transformers with Randomized Positional Encodings},
author = {Liang Hou and Cong Liu and Mingwu Zheng and Xin Tao and Pengfei Wan and Di Zhang and Kun Gai},
journal= {arXiv preprint arXiv:2503.18719},
year = {2026}
}