中文

利用扩散Transformer自身的内部动力学进行引导

计算机视觉与模式识别 2026-04-01 v2 机器学习

摘要

扩散模型展现了捕获整个(条件)数据分布的强大能力。然而,由于缺乏足够的训练和数据来学习覆盖低概率区域,模型会因无法生成与这些区域对应的高质量图像而受到惩罚。为了获得更好的生成质量,诸如无分类器引导(CFG)之类的引导策略可以在采样阶段将样本引导至高概率区域。然而,标准的 CFG 常常导致过度简化或失真的样本。另一方面,利用扩散模型的较差版本进行引导的替代路线,则受到精心设计的退化策略、额外训练和额外采样步骤的限制。在本文中,我们提出了一种简单而有效的策略——内部引导(IG),它在训练过程中对中间层引入辅助监督,并在采样过程中外推中间层和深层的输出以获得生成结果。这种简单的策略在各种基线上显著提高了训练效率和生成质量。在 ImageNet 256x256 上,SiT-XL/2+IG 在 80 和 800 个训练周期分别实现了 FID=5.31 和 FID=1.75。更令人印象深刻的是,LightningDiT-XL/1+IG 实现了 FID=1.34,在所有方法中取得了巨大优势。结合 CFG,LightningDiT-XL/1+IG 实现了当前最先进的 FID 1.19。

关键词

引用

@article{arxiv.2512.24176,
  title  = {Guiding a Diffusion Transformer with the Internal Dynamics of Itself},
  author = {Xingyu Zhou and Qifan Li and Xiaobin Hu and Hai Chen and Shuhang Gu},
  journal= {arXiv preprint arXiv:2512.24176},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Project Page: https://zhouxingyu13.github.io/Internal-Guidance/