DreamBoothDPO:使用直接偏好优化改进个性化生成
计算机视觉与模式识别
2025-05-28 v1
摘要
个性化扩散模型通过将用户定义的概念注入到多样化的上下文中,在文本到图像(T2I)生成方面取得了显著成功。然而,平衡概念保真度与上下文对齐仍然是一个具有挑战性的开放问题。在本工作中,我们提出了一种基于强化学习的方法,利用 T2I 模型的多样化输出来解决这一问题。我们的方法通过使用外部质量指标生成用于类 DPO 训练的合成配对数据集,从而消除了对人工标注分数的需求。这些优劣配对被专门构建以同时改善概念保真度和提示词遵循度。此外,我们的方法支持对图像保真度和文本对齐之间的权衡进行灵活调整。通过多步训练,我们的方法在收敛速度和输出质量上均优于朴素基线。我们进行了广泛的定性和定量分析,证明了我们的方法在各种架构和微调技术上的有效性。源代码可在 https://github.com/ControlGenAI/DreamBoothDPO 找到。
引用
@article{arxiv.2505.20975,
title = {DreamBoothDPO: Improving Personalized Generation using Direct Preference Optimization},
author = {Shamil Ayupov and Maksim Nakhodnov and Anastasia Yaschenko and Andrey Kuznetsov and Aibek Alanov},
journal= {arXiv preprint arXiv:2505.20975},
year = {2025}
}
备注
The first two authors contributed equally. The source code can be found at https://github.com/ControlGenAI/DreamBoothDPO