通过$f$-散度最小化泛化文本到图像生成的偏好对齐范式
计算机视觉与模式识别
2024-11-07 v3
摘要
直接偏好优化(DPO)最近已成功将其应用从对齐大语言模型(LLM)扩展到将文本到图像模型与人类偏好对齐,这在社区内引起了相当大的兴趣。然而,我们观察到这些方法在对齐过程中仅依赖于最小化微调模型与参考模型之间的反向Kullback-Leibler散度,忽略了其他散度约束的引入。在本研究中,我们专注于将文本到图像模型对齐范式中的反向Kullback-Leibler散度扩展到-散度,旨在获得更好的对齐性能以及良好的生成多样性。我们给出了-散度条件下对齐范式的广义公式,并从梯度场的角度深入分析了不同散度约束对齐过程的影响。我们在不同散度约束下对图像-文本对齐性能、人类价值对齐性能和生成多样性性能进行了全面评估,结果表明基于Jensen-Shannon散度的对齐实现了三者之间的最佳权衡。用于对齐文本到图像模型的散度选择显著影响对齐性能(尤其是人类价值对齐)与生成多样性之间的权衡,这凸显了在实际应用中选择合适散度的必要性。
引用
@article{arxiv.2409.09774,
title = {Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization},
author = {Haoyuan Sun and Bo Xia and Yongzhe Chang and Xueqian Wang},
journal= {arXiv preprint arXiv:2409.09774},
year = {2024}
}
备注
34 pages