中文

UniFL:通过统一反馈学习改进潜在扩散模型

计算机视觉与模式识别 2024-11-27 v3

摘要

潜在扩散模型(LDM)彻底改变了文本到图像的生成,推动了各种先进模型和多样化下游应用的涌现。然而,尽管取得了这些重大进展,当前的扩散模型仍存在若干局限性,包括视觉质量欠佳、美学吸引力不足和推理效率低下,且尚无全面的解决方案。为了应对这些挑战,我们提出了 UniFL,这是一个利用反馈学习全面增强扩散模型的统一框架。UniFL 作为一种通用、有效且具泛化能力的解决方案,可适用于各种扩散模型,如 SD1.5 和 SDXL。值得注意的是,UniFL 包含三个关键组件:增强视觉质量的感知反馈学习;提升美学吸引力的解耦反馈学习;以及加速推理的对抗反馈学习。深入的实验和广泛的用户研究验证了我们的方法在提升生成质量和推理加速方面的卓越性能。例如,在生成质量方面,UniFL 的用户偏好比 ImageReward 高出 17%;在 4 步推理下,其总体偏好分别比 LCM 和 SDXL Turbo 高出 57% 和 20%。

关键词

引用

@article{arxiv.2404.05595,
  title  = {UniFL: Improve Latent Diffusion Model via Unified Feedback Learning},
  author = {Jiacheng Zhang and Jie Wu and Yuxi Ren and Xin Xia and Huafeng Kuang and Pan Xie and Jiashi Li and Xuefeng Xiao and Weilin Huang and Shilei Wen and Lean Fu and Guanbin Li},
  journal= {arXiv preprint arXiv:2404.05595},
  year   = {2024}
}

备注

Accepted by Neurips2024