用于微调文本到图像扩散模型的深度奖励监督
计算机视觉与模式识别
2024-05-03 v1 人工智能
摘要
利用给定的奖励函数优化文本到图像扩散模型是一个重要但尚未充分探索的研究领域。在本研究中,我们提出了深度奖励微调(Deep Reward Tuning,DRTune),这是一种直接监督文本到图像扩散模型最终输出图像,并通过迭代采样过程将梯度反向传播至输入噪声的算法。我们发现,在采样过程的早期步骤进行训练对于低级奖励至关重要,并且通过截断去噪网络输入的梯度,可以高效且有效地实现深度监督。DRTune 在各种奖励模型上进行了广泛评估。它始终优于其他算法,特别是在所有浅层监督方法均失效的低级控制信号方面。此外,我们通过 DRTune 微调 Stable Diffusion XL 1.0(SDXL 1.0)模型以优化 Human Preference Score v2.1,从而得到了 Favorable Diffusion XL 1.0(FDXL 1.0)模型。与 SDXL 1.0 相比,FDXL 1.0 显著提升了图像质量,并达到了与 Midjourney v5.2 相当的质量。
引用
@article{arxiv.2405.00760,
title = {Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models},
author = {Xiaoshi Wu and Yiming Hao and Manyuan Zhang and Keqiang Sun and Zhaoyang Huang and Guanglu Song and Yu Liu and Hongsheng Li},
journal= {arXiv preprint arXiv:2405.00760},
year = {2024}
}
备注
N/A