中文

LEDiT:无需位置编码的长度可外推扩散Transformer

计算机视觉与模式识别 2025-09-25 v3

摘要

扩散Transformer(DiTs)在生成高于训练分辨率的图像时面临困难。主要障碍在于显式位置编码(PE)(如RoPE)需要外推到未见位置,当推理分辨率与训练分辨率不同时会导致性能下降。本文提出了一种长度可外推扩散Transformer(LEDiT)以克服这一限制。LEDiT不需要显式的位置编码,从而避免了PE外推。LEDiT的关键创新在于因果注意力的使用。我们证明因果注意力可以隐式地编码全局位置信息,并表明此类信息有助于外推。我们进一步引入了一个局部增强模块,用于捕获细粒度的局部信息以补充因果注意力编码的全局粗粒度位置信息。在条件生成和文本到图像生成任务上的实验结果表明,LEDiT支持高达4倍的分辨率缩放(例如从256×256到512×512),与最先进的长度外推方法相比实现了更好的图像质量。我们认为LEDiT标志着对标准基于RoPE方法的偏离,并为长度外推提供了有前景的见解。项目页面:https://shenzhang2145.github.io/ledit/

关键词

引用

@article{arxiv.2503.04344,
  title  = {LEDiT: Your Length-Extrapolatable Diffusion Transformer without Positional Encoding},
  author = {Shen Zhang and Siyuan Liang and Yaning Tan and Zhaowei Chen and Linze Li and Ge Wu and Yuhao Chen and Shuheng Li and Zhenyu Zhao and Caihua Chen and Jiajun Liang and Yao Tang},
  journal= {arXiv preprint arXiv:2503.04344},
  year   = {2025}
}