RAPHAEL:通过大规模扩散路径混合实现文本到图像生成
计算机视觉与模式识别
2024-03-12 v5
摘要
文本到图像生成近来取得显著成就。我们提出一种文本条件图像扩散模型,称为 RAPHAEL,用于生成高度艺术化的图像,其准确刻画文本提示,涵盖多个名词、形容词与动词。这是通过堆叠数十个专家混合(MoE)层(即空间-MoE 与时间-MoE 层)实现的,从而启用从网络输入到输出的数十亿条扩散路径(路由)。每条路径直观地充当一名“画师”,在扩散时间步上将特定文本概念描绘到指定图像区域。综合实验表明,RAPHAEL 在图像质量与美学吸引力上均优于近期前沿模型,如 Stable Diffusion、ERNIE-ViLG 2.0、DeepFloyd 和 DALL-E 2。首先,RAPHAEL 在日漫、写实、赛博朋克与水墨插画等多种风格间切换图像时表现优异。其次,一个拥有三十亿参数、在 1000 块 A100 GPU 上训练两个月的单一模型,在 COCO 数据集上取得了 6.61 的 state-of-the-art 零样本 FID 分数。此外,RAPHAEL 在 ViLG-300 基准的人类评估中大幅超越同类模型。我们相信 RAPHAEL 有潜力推动学术界与工业界图像生成研究的前沿,为该快速发展领域的未来突破铺平道路。更多细节见网页:https://raphael-painter.github.io/。
引用
@article{arxiv.2305.18295,
title = {RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths},
author = {Zeyue Xue and Guanglu Song and Qiushan Guo and Boxiao Liu and Zhuofan Zong and Yu Liu and Ping Luo},
journal= {arXiv preprint arXiv:2305.18295},
year = {2024}
}
备注
NeurIPS 2023