中文

利用人类反馈微调扩散模型且无需任何奖励模型

机器学习 2024-03-26 v3 人工智能 计算机视觉与模式识别

摘要

利用带人类反馈的强化学习(RLHF)在微调扩散模型方面已展现出显著前景。先前方法先训练一个与人类偏好对齐的奖励模型,再借助RL技术微调底层模型。然而,构建一个高效的奖励模型需要大量数据集、最优架构与人工超参数调优,使该过程耗时且昂贵。直接偏好优化(DPO)方法在微调大语言模型中有效,消除了对奖励模型的需求。但扩散模型去噪过程巨大的GPU内存需求阻碍了DPO方法的直接应用。为解决此问题,我们引入去噪扩散策略优化的直接偏好(D3PO)方法以直接微调扩散模型。理论分析表明,尽管D3PO省略了奖励模型训练,它实际上等效于利用人类反馈数据训练的最优奖励模型来引导学习过程。该方法无需训练奖励模型,更为直接、经济,且最小化计算开销。实验中,我们的方法以目标的相对尺度作为人类偏好的代理,取得了与使用真实奖励的方法相当的结果。此外,D3PO展现出降低图像失真率并生成更安全图像的能力,克服了缺乏鲁棒奖励模型的挑战。我们的代码公开于 https://github.com/yk7333/D3PO。

关键词

引用

@article{arxiv.2311.13231,
  title  = {Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model},
  author = {Kai Yang and Jian Tao and Jiafei Lyu and Chunjiang Ge and Jiaxin Chen and Qimai Li and Weihan Shen and Xiaolong Zhu and Xiu Li},
  journal= {arXiv preprint arXiv:2311.13231},
  year   = {2024}
}

备注

CVPR 2024 accepted; huggingface daily paper