中文

解析文本到图像扩散模型中的最优奖励-多样性权衡

计算机视觉与模式识别 2024-09-11 v1 人工智能

摘要

文本到图像扩散模型已成为从文本提示生成高保真图像的重要工具。然而,在无过滤互联网数据上训练的模型会产生不安全、错误或风格不理想且不符合人类偏好的图像。为此,最近的做法包括纳入人类偏好数据集以微调 T2I 模型或优化捕获这些偏好的奖励函数。尽管有效,但这些方法易受奖励攻击,导致模型对奖励函数过拟合,引起生成图像的多样性丧失。本文证明了奖励攻击的必然性,并研究了诸如 KL 散度和 LoRA 比例缩放等自然正则化技术及其局限性。我们还引入了退火重要性引导(AIG),这是一种受退火重要性抽样启发的推断时正则化方法,旨在保留基础模型的多样性,同时实现奖励-多样性的帕累托最优权衡。我们的实验表明,AIG 对 Stable Diffusion 模型具有显著益处,在奖励优化与图像多样性之间实现最佳平衡。此外,用户研究确认,AIG 在不同模型架构和奖励函数下均提升了生成图像的多样性和质量。

关键词

引用

@article{arxiv.2409.06493,
  title  = {Elucidating Optimal Reward-Diversity Tradeoffs in Text-to-Image Diffusion Models},
  author = {Rohit Jena and Ali Taghibakhshi and Sahil Jain and Gerald Shen and Nima Tajbakhsh and Arash Vahdat},
  journal= {arXiv preprint arXiv:2409.06493},
  year   = {2024}
}