中文

AGFSync:利用 AI 生成反馈进行文本到图像生成的偏好优化

计算机视觉与模式识别 2025-01-03 v6

摘要

文本到图像(T2I)扩散模型在图像生成方面取得了显著的成功。尽管已有进展,但在 prompt-following ability、image quality 以及缺乏高质量数据集方面仍面临挑战,这些数据集是细化这些模型的关键。由于获取标记数据成本高昂,我们引入 AGFSync,一个通过直接偏好优化(DPO)实现 T2I 扩散模型提升的全 AI 驱动框架。AGFSync 利用视觉语言模型(VLM)评估图像在风格、连贯性和美学方面的质量,在 AI 驱动的循环中生成反馈数据。通过将 AGFSync 应用于领先的 T2I 模型,如 SD v1.4、v1.5 和 SDXL-base,我们在 TIFA 数据集上的大量实验表明,AGFSync 在 VQA 分数、审美评估和 HPSv2 基准测试方面均实现了显著提升,始终优于基础模型。AGFSync 的 T2I 扩散模型细化方法为可扩展的对齐技术指明了方向。我们的代码和数据集已公开于 https://anjingkun.github.io/AGFSync。

关键词

引用

@article{arxiv.2403.13352,
  title  = {AGFSync: Leveraging AI-Generated Feedback for Preference Optimization in Text-to-Image Generation},
  author = {Jingkun An and Yinghao Zhu and Zongjian Li and Enshen Zhou and Haoran Feng and Xijie Huang and Bohua Chen and Yemin Shi and Chengwei Pan},
  journal= {arXiv preprint arXiv:2403.13352},
  year   = {2025}
}

备注

Accepted by AAAI-2025