Playground v3:利用深度融合大型语言模型改进文本到图像的对齐
计算机视觉与模式识别
2024-10-23 v2 人工智能
图形学
摘要
我们介绍了Playground v3(PGv3),这是我们最新的文本到图像模型,在多个测试基准上实现了最先进的性能,在图形设计能力上表现出色,并引入了新功能。与依赖预训练语言模型(如T5或CLIP文本编码器)的传统文本到图像生成模型不同,我们的方法将大型语言模型与一种新颖的结构完全集成,该结构仅利用来自仅解码器LLM的文本条件。此外,为了提高图像描述质量,我们开发了一个内部描述器,能够生成具有不同细节级别的描述,丰富了文本结构的多样性。我们还引入了一个新的基准CapsBench,用于评估详细的图像描述性能。实验结果表明,PGv3在文本提示遵循、复杂推理和准确的文本渲染方面表现出色。用户偏好研究表明,我们的模型在常见设计应用(如贴纸、海报和标志设计)中具有超人的图形设计能力。此外,PGv3引入了新功能,包括精确的RGB颜色控制和强大的多语言理解能力。
引用
@article{arxiv.2409.10695,
title = {Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models},
author = {Bingchen Liu and Ehsan Akhgari and Alexander Visheratin and Aleks Kamko and Linmiao Xu and Shivam Shrirao and Chase Lambert and Joao Souza and Suhail Doshi and Daiqing Li},
journal= {arXiv preprint arXiv:2409.10695},
year = {2024}
}
备注
Project page: https://playground.com/pg-v3