中文

基于沙漏扩散 Transformer 的可扩展高分辨率像素空间图像合成

计算机视觉与模式识别 2026-03-27 v2 人工智能 机器学习

摘要

我们提出了沙漏扩散 Transformer(HDiT),这是一种图像生成模型,其随像素数量呈线性扩展,支持直接在像素空间进行高分辨率(例如 1024×10241024 \times 1024)训练。它建立在可扩展至数十亿参数的 Transformer 架构之上,弥合了卷积 U-Net 的效率与 Transformer 的可扩展性之间的差距。HDiT 无需使用多尺度架构、潜空间自编码器或自条件化等典型的高分辨率训练技术即可成功训练。我们证明 HDiT 在 ImageNet 2562256^2 上与现有模型表现相当,并在 FFHQ-102421024^2 上为扩散模型创造了新的 SOTA。

关键词

引用

@article{arxiv.2401.11605,
  title  = {Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion Transformers},
  author = {Katherine Crowson and Stefan Andreas Baumann and Alex Birch and Tanishq Mathew Abraham and Daniel Z. Kaplan and Enrico Shippole},
  journal= {arXiv preprint arXiv:2401.11605},
  year   = {2026}
}

备注

20 pages, 13 figures, project page and code available at https://crowsonkb.github.io/hourglass-diffusion-transformers/