基于偏好强化学习的主体驱动文本到图像生成
计算机视觉与模式识别
2024-12-24 v3 人工智能
机器学习
摘要
文本到图像生成模型近年来受到广泛关注,能够从文本提示生成高质量图像。然而,这些模型往往缺乏从给定参考图像生成特定主体或在不同条件下合成新表现的能力。诸如DreamBooth和主体驱动文本到图像(SuTI)等方法在这方面取得了重要进展。然而,这两种方法主要聚焦于增强对参考图像的相似性,需要高昂的setup,往往忽视了高效训练和避免对参考图像过拟合的需求。本文提出了-Harmonic奖励函数,提供可靠的奖励信号,使模型能够实现更快的训练和有效的正则化。通过结合Bradley-Terry偏好模型,-Harmonic奖励函数还为主体驱动生成任务提供偏好标签。我们提出了奖励偏好优化(RPO),该方法setup更简单(仅需DreamBooth使用的负样本的3%),且梯度步数更少即可完成微调。不同于现有方法,本方法无需训练文本编码器或优化文本嵌入,仅通过微调U-Net组件即可实现文本-图像对齐。实验表明,-Harmonic在主体驱动生成任务中 proves to be a reliable approach for model selection。基于-Harmonic奖励函数提供的偏好标签和早期停止验证,我们的算法在DreamBench上实现了最新的CLIP-I得分0.833和CLIP-T得分0.314。
引用
@article{arxiv.2407.12164,
title = {Subject-driven Text-to-Image Generation via Preference-based Reinforcement Learning},
author = {Yanting Miao and William Loh and Suraj Kothawade and Pascal Poupart and Abdullah Rashwan and Yeqing Li},
journal= {arXiv preprint arXiv:2407.12164},
year = {2024}
}
备注
NeurIPS 2024