中文

扩散模型用于文本到图像生成的自博弈微调

机器学习 2024-02-16 v1 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

微调扩散模型仍然是生成式人工智能 (GenAI) 中一个未被充分探索的前沿领域,尤其是与大型语言模型 (LLMs) 微调取得的显著进展相比。虽然 Stable Diffusion (SD) 和 SDXL 等尖端扩散模型依赖于监督微调,但其性能在看到一定数量的数据后不可避免地会遇到瓶颈。最近,强化学习 (RL) 已被用于利用人类偏好数据微调扩散模型,但这需要每个文本提示至少包含两张图像(“赢家”和“输家”图像)。在本文中,我们介绍了一种名为扩散模型自博弈微调 (SPIN-Diffusion) 的创新技术,其中扩散模型与其早期版本进行竞争,从而促进迭代自我改进过程。我们的方法为传统的监督微调和 RL 策略提供了一种替代方案,显著提高了模型性能和对齐度。我们在 Pick-a-Pic 数据集上的实验表明,SPIN-Diffusion 从第一次迭代起就在人类偏好对齐和视觉吸引力方面优于现有的监督微调方法。到第二次迭代时,它在所有指标上均超越了基于 RLHF 的方法,且所需数据更少。

关键词

引用

@article{arxiv.2402.10210,
  title  = {Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation},
  author = {Huizhuo Yuan and Zixiang Chen and Kaixuan Ji and Quanquan Gu},
  journal= {arXiv preprint arXiv:2402.10210},
  year   = {2024}
}

备注

28 pages, 8 figures, 10 tables