中文

Flash-DMD:面向高保真少步图像生成的高效蒸馏与联合强化学习

计算机视觉与模式识别 2025-11-26 v1 人工智能

摘要

扩散模型已成为领先的生成模型之一,但其迭代采样过程仍显得计算昂贵。时间步蒸馏是加速生成的有前景技术,但通常需要大量训练且会导致图像质量下降。此外,使用强化学习(RL)对这些蒸馏模型进行微调以实现特定目标(如审美吸引力或用户偏好) notoriously 不稳定,容易陷入奖励攻击。在本工作中,我们引入 Flash-DMD 框架,实现蒸馏快速收敛与联合 RL 精炼。具体而言,我们提出了一种高效的时间步感知蒸馏策略,显著降低训练成本并提升真实感,仅为 DMD2 的 2.1%2.1\% 训练成本。随后,我们引入联合训练方案,在蒸馏训练持续进行的同时,对模型进行 RL 目标微调。我们展示,持续进行的蒸馏所产生的稳定、明确定义的损失作为强大的正则化器,有效稳定了 RL 训练过程并防止策略崩溃。在基于评分模型和流匹配模型的大量实验中表明,我们提出的 Flash-DMD 不仅收敛显著更快,还在少步采样范式下实现了领先的生成质量,在视觉质量、人类偏好和文本-图像对齐指标方面均优于现有方法。我们的工作呈现了一种有效的训练高效、高保真且稳定生成模型的范式。代码即将发布。

关键词

引用

@article{arxiv.2511.20549,
  title  = {Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning},
  author = {Guanjie Chen and Shirui Huang and Kai Liu and Jianchen Zhu and Xiaoye Qu and Peng Chen and Yu Cheng and Yifu Sun},
  journal= {arXiv preprint arXiv:2511.20549},
  year   = {2025}
}