中文

弱到强的扩散与反射

机器学习 2025-04-25 v3 计算机视觉与模式识别

摘要

扩散生成模型的目标是通过梯度得分匹配将学习到的分布与真实数据分布对齐。然而,由于训练数据质量、建模策略和架构设计的内在局限性,生成输出与真实数据之间不可避免地存在差距。为缩小这一差距,我们提出一种新框架,即弱到强扩散(Weak-to-Strong Diffusion, W2SD),该框架利用估计算出的现有弱模型与强模型之间的差异(即弱到强差异)来桥接理想模型与强模型之间的差距。通过采用一种反射操作,在去噪和反转之间交替使用弱到强差异,我们理论上理解到,W2SD沿着采样轨迹引导潜在变量向真实数据分布的区域移动。W2SD高度灵活且广泛适用,通过战略性地选择弱到强模型对(例如 DreamShaper 与 SD1.5,优秀专家与差差专家在混合专家模型中),可以实现多样化的改进。大量实验表明,W2SD在人类偏好、审美质量和提示遵循度方面显著提升,实现了在各种模态(如图像、视频)、架构(如基于UNet的、基于DiT的、基于MoE的)和基准测试上的SOTA性能。例如,搭载W2SD的Juggernaut-XL可使HPSv2获胜率提升至原结果的90%。此外,W2SD实现的性能提升显著超过其额外的计算开销,而不同弱到强差异的累计改进进一步巩固了其实际实用性和可部署性。

关键词

引用

@article{arxiv.2502.00473,
  title  = {Weak-to-Strong Diffusion with Reflection},
  author = {Lichen Bai and Masashi Sugiyama and Zeke Xie},
  journal= {arXiv preprint arXiv:2502.00473},
  year   = {2025}
}

备注

23 pages, 23 figures, 15 tables