无需偏好图像对的文本到图像扩散模型免费对齐
计算机视觉与模式识别
2025-10-01 v1 人工智能
摘要
基于扩散的文本到图像(T2I)模型的最新进展在根据文本提示生成高质量图像方面取得了显著成功。然而,确保文本与生成图像之间的精确对齐,对于最先进的扩散模型来说仍然是一个重大挑战。为解决此问题,现有研究采用基于人类反馈的强化学习(RLHF)来使T2I输出与人类偏好对齐。但这些方法要么直接依赖成对的图像偏好数据,要么需要一个学习到的奖励函数,两者都严重依赖昂贵、高质量的人工标注,因此面临可扩展性的限制。在这项工作中,我们引入了文本偏好优化(TPO)框架,该框架实现了T2I模型的“免费午餐”式对齐,无需成对的图像偏好数据即可完成对齐。TPO通过训练模型使其偏好匹配的提示而非不匹配的提示来工作,其中不匹配的提示是通过使用大语言模型扰动原始描述构建的。我们的框架具有通用性,并与现有的基于偏好的算法兼容。我们将DPO和KTO扩展到我们的设置中,得到了TDPO和TKTO。跨多个基准的定量和定性评估表明,我们的方法始终优于其原始对应方法,提供了更好的人类偏好分数和改善的文本到图像对齐。我们的开源代码可在https://github.com/DSL-Lab/T2I-Free-Lunch-Alignment获取。
引用
@article{arxiv.2509.25771,
title = {Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs},
author = {Jia Jun Cheng Xian and Muchen Li and Haotian Yang and Xin Tao and Pengfei Wan and Leonid Sigal and Renjie Liao},
journal= {arXiv preprint arXiv:2509.25771},
year = {2025}
}