中文

SEE-DPO: 自熵增强直接偏好优化

计算机视觉与模式识别 2025-03-21 v2

摘要

直接偏好优化(DPO)已成功用于根据人类偏好对齐大语言模型(LLM),最近也被应用于提升文本到图像扩散模型的质量。然而,基于DPO的方法如SPO、Diffusion-DPO和D3PO极易过拟合和奖励黑客攻击,特别是在生成模型在长时间训练中被优化以拟合分布外数据时。为了克服这些挑战并稳定扩散模型的训练,我们在基于人类反馈的强化学习中引入了一种自熵正则化机制。这种增强通过鼓励更广泛的探索和更高的鲁棒性来改进DPO训练。我们的正则化技术有效缓解了奖励黑客攻击,在潜在空间中实现了更好的稳定性和更高的图像质量。大量实验表明,将人类反馈与自熵正则化相结合,可以显著提升图像的多样性和特异性,在关键图像生成指标上取得了最先进的结果。

关键词

引用

@article{arxiv.2411.04713,
  title  = {Multi-Reward as Condition for Instruction-based Image Editing},
  author = {Xin Gu and Ming Li and Libo Zhang and Fan Chen and Longyin Wen and Tiejian Luo and Sijie Zhu},
  journal= {arXiv preprint arXiv:2411.04713},
  year   = {2025}
}