中文

扩散模型的个性化偏好微调

机器学习 2025-01-14 v1 计算机视觉与模式识别

摘要

诸如 DPO 之类的 RLHF 技术可以显著提高文本到图像扩散模型的生成质量。然而,这些方法优化的是将模型生成与群体级偏好对齐的单一奖励,忽略了个体用户信念或价值观的细微差别。这种个性化的缺乏限制了这些模型的有效性。为了弥合这一差距,我们引入了 PPD,一种将扩散模型与个性化偏好对齐的多奖励优化目标。通过 PPD,扩散模型以少样本的方式学习用户群体的个体偏好,从而能够泛化到未见过的用户。具体而言,我们的方法 (1) 利用视觉语言模型 (VLM) 从一小组成对偏好示例中提取个人偏好嵌入,然后 (2) 通过交叉注意力将这些嵌入整合到扩散模型中。以用户嵌入为条件,使用 DPO 目标对文本到图像模型进行微调,同时优化以与多个用户的偏好对齐。实证结果表明,我们的方法有效地优化了多个奖励函数,并能在推理期间在它们之间进行插值。在真实用户场景中,仅需来自新用户的四个偏好示例,我们的方法就比 Stable Cascade 实现了 76% 的平均胜率,生成的图像能更准确地反映特定用户的偏好。

关键词

引用

@article{arxiv.2501.06655,
  title  = {Personalized Preference Fine-tuning of Diffusion Models},
  author = {Meihua Dang and Anikait Singh and Linqi Zhou and Stefano Ermon and Jiaming Song},
  journal= {arXiv preprint arXiv:2501.06655},
  year   = {2025}
}