PAI-Diffusion:构建并服务于云端一系列用于文本到图像生成的开源中文扩散模型
计算与语言
2023-09-12 v1 人工智能
计算机视觉与模式识别
摘要
由于汉语词汇量大且字符关系复杂,中文文本到图像合成面临独特挑战。尽管现有扩散模型在从文本描述生成图像方面已展现出潜力,但它们往往忽视特定领域语境,且在处理中文时缺乏鲁棒性。本文介绍PAI-Diffusion,一个解决上述局限性的综合框架。PAI-Diffusion包含通用与领域特定的中文扩散模型,能够生成具有语境相关性的图像。它探索了使用LoRA和ControlNet进行细粒度图像风格迁移与图像编辑的潜力,赋予用户对图像生成更强的控制力。此外,PAI-Diffusion与阿里巴巴云的人工智能机器学习平台无缝集成,提供可及且可扩展的解决方案。所有中文扩散模型检查点、LoRA及ControlNet(包括领域特定的)均公开可用。用户友好的中文WebUI与diffusers-api弹性推理工具包也已开源,进一步促进了PAI-Diffusion模型在各种环境中的轻松部署,使其成为中文文本到图像合成的宝贵资源。
引用
@article{arxiv.2309.05534,
title = {PAI-Diffusion: Constructing and Serving a Family of Open Chinese Diffusion Models for Text-to-image Synthesis on the Cloud},
author = {Chengyu Wang and Zhongjie Duan and Bingyan Liu and Xinyi Zou and Cen Chen and Kui Jia and Jun Huang},
journal= {arXiv preprint arXiv:2309.05534},
year = {2023}
}