eDiff-I:采用专家去噪器集成的中文文本到图像扩散模型
计算机视觉与模式识别
2023-03-15 v5 机器学习
摘要
基于大规模扩散的生成模型已在文本条件高分辨率图像合成中取得突破。此类文本到图像扩散模型从随机噪声出发,在迭代过程中依据文本提示逐步合成图像。我们发现,其合成行为在整个过程中发生定性变化:在采样早期,生成强烈依赖文本提示以产生与文本对齐的内容;而在后期,文本条件几乎被完全忽略。这表明在整个生成过程中共享模型参数可能并不理想。因此,与现有工作不同,我们提出训练一组专用于不同合成阶段的文本到图像扩散模型。为保持训练效率,我们首先训练单一模型,随后将其拆分为针对迭代生成特定阶段训练的专用模型。我们称为 eDiff-I 的扩散模型集成在保持相同推理计算成本并维持高视觉质量的同时,改善了文本对齐,在标准基准上优于先前的大规模文本到图像扩散模型。此外,我们训练模型以利用多种嵌入进行条件控制,包括 T5 文本、CLIP 文本和 CLIP 图像嵌入。我们展示这些不同嵌入导致不同行为。值得注意的是,CLIP 图像嵌入提供了一种直观方式,可将参考图像的风格迁移到目标文本到图像输出。最后,我们展示一种使 eDiff-I 具备“用词语绘画”能力的技术。用户可选择输入文本中的词语并在画布上绘制以控制输出,这对于构思所需图像非常便捷。项目页面见 https://deepimagination.cc/eDiff-I/
引用
@article{arxiv.2211.01324,
title = {eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers},
author = {Yogesh Balaji and Seungjun Nah and Xun Huang and Arash Vahdat and Jiaming Song and Qinsheng Zhang and Karsten Kreis and Miika Aittala and Timo Aila and Samuli Laine and Bryan Catanzaro and Tero Karras and Ming-Yu Liu},
journal= {arXiv preprint arXiv:2211.01324},
year = {2023}
}