中文

ImageNet 扩散模型的速通训练

计算机视觉与模式识别 2025-12-16 v1

摘要

近期的进展显著提升了扩散 Transformer 的训练效率。然而,这些技术大多被孤立研究,尚未探索结合多种方法可能带来的协同效应。我们提出了 SR-DiT(Speedrun Diffusion Transformer,速通扩散 Transformer),这是一个在表征对齐基础上系统整合 token 路由、架构改进和训练修改的框架。我们的方法在 ImageNet-256 上仅使用 140M 参数模型、在 400K 迭代下且无需无分类器引导,即取得了 FID 3.49 和 KDD 0.319 的结果——这与参数量显著更大(685M)且训练时间长得多的模型所取得的结果相当。据我们所知,这是该模型尺寸下的 SOTA 结果。通过广泛的消融研究,我们确定了哪些技术组合最为有效,并记录了其中的协同与不兼容性。我们发布了我们的框架,作为供未来研究使用的计算上易于获取的基线。

关键词

引用

@article{arxiv.2512.12386,
  title  = {Speedrunning ImageNet Diffusion},
  author = {Swayam Bhanded},
  journal= {arXiv preprint arXiv:2512.12386},
  year   = {2025}
}