中文

Playground v2.5:提升文本到图像生成美学质量的三个见解

计算机视觉与模式识别 2024-02-28 v1 人工智能

摘要

在这项工作中,我们分享了在文本到图像生成模型中实现最先进美学质量的三个见解。我们专注于模型改进的三个关键方面:增强色彩和对比度、改善多种纵横比的生成以及提升以人为本的细节。首先,我们深入探讨了噪声调度在训练扩散模型中的重要性,证明了其对真实感和视觉保真度的深远影响。其次,我们解决了图像生成中适应各种纵横比的挑战,强调了准备平衡的分桶数据集的重要性。最后,我们研究了使模型输出与人类偏好保持一致的关键作用,确保生成的图像符合人类的感知期望。通过广泛的分析和实验,Playground v2.5 在各种条件和纵横比下展示了美学质量方面的最先进性能,优于 SDXL 和 Playground v2 等广泛使用的开源模型,以及 DALLE 3 和 Midjourney v5.2 等闭源商业系统。我们的模型是开源的,我们希望 Playground v2.5 的开发能为旨在提升基于扩散的图像生成模型美学质量的研究人员提供有价值的指导。

关键词

引用

@article{arxiv.2402.17245,
  title  = {Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation},
  author = {Daiqing Li and Aleks Kamko and Ehsan Akhgari and Ali Sabet and Linmiao Xu and Suhail Doshi},
  journal= {arXiv preprint arXiv:2402.17245},
  year   = {2024}
}

备注

Model weights: https://huggingface.co/playgroundai/playground-v2.5-1024px-aesthetic