中文

基于间隙感知的偏好优化:无参考模型对齐扩散模型

计算机视觉与模式识别 2025-12-04 v2

摘要

现代偏好对齐方法(如 DPO)依赖对参考模型的散度正则化以保证训练稳定性——但这会导致我们称之为“参考不匹配”的根本问题。本文探讨了参考不匹配对文本到图像(T2I)扩散模型对齐的负面影响,表明在相同数据量下,参考不匹配程度越大,对有效适应性就越差,例如当学习新的艺术风格或针对特定物体进行个性化时。我们在文本到图像(T2I)扩散模型上展示了这一现象,并引入间隙感知偏好优化(MaPO)——一种无需参考模型的方法,摆脱了这一约束。通过直接在Bradley-Terry模型下优化优选输出与劣选输出之间的似然比间隙,而无需锚定参考模型,MaPO将多样化的T2I任务转化为统一的两两偏好优化。我们在五个具有挑战性的领域验证了MaPO的多样性:(1)安全生成、(2)风格适应、(3)文化表征、(4)个性化和(5)通用偏好对齐。我们的结果表明,随着参考不匹配程度的加剧,MaPO的优势会显著提升,超越DPO和诱人方法(如DreamBooth),同时将训练时间缩短15%。因此,MaPO作为通用T2I适应任务的一种多功能且高效的方法,凸显了其优势。

关键词

引用

@article{arxiv.2406.06424,
  title  = {Margin-aware Preference Optimization for Aligning Diffusion Models without Reference},
  author = {Jiwoo Hong and Sayak Paul and Noah Lee and Kashif Rasul and James Thorne and Jongheon Jeong},
  journal= {arXiv preprint arXiv:2406.06424},
  year   = {2025}
}

备注

Accepted to AAAI 2026 Main Technical Track