中文

SD-DiT:在 Diffusion Transformer 中释放自监督判别的力量

计算机视觉与模式识别 2024-03-26 v1 多媒体

摘要

Diffusion Transformer (DiT) 已成为图像生成领域生成式扩散模型的新趋势。鉴于典型 DiT 收敛极其缓慢,近期的突破由掩码策略驱动,该策略通过额外的图像内上下文学习显著提升了 DiT 的训练效率。尽管取得了这些进展,掩码策略仍存在两个固有局限性:训练-推理差异,以及掩码重建与生成扩散过程之间模糊的关系,导致 DiT 的训练次优。在本工作中,我们通过新颖地释放自监督判别知识来提升 DiT 训练,从而解决了这些局限性。在技术上,我们将 DiT 构建为师生模式。师生判别对建立在沿同一概率流常微分方程(PF-ODE)的扩散噪声之上。我们不再对 DiT 编码器和解码器同时应用掩码重建损失,而是将 DiT 编码器和解码器解耦,以分别处理判别和生成目标。具体而言,通过用学生和教师 DiT 编码器对判别对进行编码,我们设计了一种新的判别损失,以鼓励在自监督嵌入空间中进行图像间对齐。之后,学生样本被送入学生 DiT 解码器以执行典型的生成扩散任务。我们在 ImageNet 数据集上进行了大量实验,我们的方法在训练成本和生成能力之间取得了有竞争力的平衡。

关键词

引用

@article{arxiv.2403.17004,
  title  = {SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer},
  author = {Rui Zhu and Yingwei Pan and Yehao Li and Ting Yao and Zhenglong Sun and Tao Mei and Chang Wen Chen},
  journal= {arXiv preprint arXiv:2403.17004},
  year   = {2024}
}

备注

CVPR 2024