ImageReFL:在人类对齐的扩散模型中平衡质量与多样性
计算机视觉与模式识别
2025-05-29 v1
摘要
扩散模型的最新进展带来了令人印象深刻的图像生成能力,但将这些模型与人类偏好对齐仍然具有挑战性。使用基于人类反馈训练的模型进行基于奖励的微调可以改善对齐效果,但通常会损害多样性,导致输出缺乏变化。在本研究中,我们通过两项贡献来解决这一权衡问题。首先,我们引入了 \textit{combined generation},这是一种新颖的采样策略,仅在生成过程的后期阶段应用奖励微调的扩散模型,而在早期步骤中保留基础模型。这种方法缓解了早期阶段的过拟合,并有助于保留全局结构和多样性。其次,我们提出了 \textit{ImageReFL},这是一种通过在真实图像上训练并结合多种正则化器(包括扩散损失和 ReFL 损失)来提高图像多样性且质量损失极小的微调方法。我们的方法在标准质量和多样性指标上优于传统的奖励微调方法。用户研究进一步证实,我们的方法更好地平衡了人类偏好对齐与视觉多样性。源代码可在 https://github.com/ControlGenAI/ImageReFL 找到。
引用
@article{arxiv.2505.22569,
title = {ImageReFL: Balancing Quality and Diversity in Human-Aligned Diffusion Models},
author = {Dmitrii Sorokin and Maksim Nakhodnov and Andrey Kuznetsov and Aibek Alanov},
journal= {arXiv preprint arXiv:2505.22569},
year = {2025}
}
备注
The source code can be found at https://github.com/ControlGenAI/ImageReFL