AltDiffusion:一种多语言文本到图像扩散模型
计算机视觉与模式识别
2023-08-24 v2
摘要
大型文本到图像(T2I)扩散模型已展现出基于文本输入生成逼真且多样图像的卓越能力。然而,现有工作仅支持有限的语言输入,如英语、汉语与日语,使这些语言之外的用户得不到充分服务,并阻碍了 T2I 模型的全球推广。因此,本文提出 AltDiffusion,一种支持十八种不同语言的新颖多语言 T2I 扩散模型。具体而言,我们首先基于知识蒸馏训练一个多语言文本编码器。随后将其接入预训练的仅支持英语的扩散模型,并以两阶段方案(包括大规模多语言数据集上的概念对齐与质量提升阶段)训练模型以增强多语言能力。此外,我们引入一个新基准,包含多语言通用-18(MG-18)与多语言文化-18(MC-18)数据集,用以评估 T2I 扩散模型在不同语言中生成高质量图像与捕捉文化特定概念的能力。在 MG-18 与 MC-18 上的实验结果表明,AltDiffusion 在多语言理解(尤其就文化特定概念而言)上优于当前最优 T2I 模型(如 Stable Diffusion),同时仍具备可媲美的生成高质量图像能力。所有源代码与检查点可在 https://github.com/superhero-7/AltDiffuson 找到。
引用
@article{arxiv.2308.09991,
title = {AltDiffusion: A Multilingual Text-to-Image Diffusion Model},
author = {Fulong Ye and Guang Liu and Xinya Wu and Ledell Wu},
journal= {arXiv preprint arXiv:2308.09991},
year = {2023}
}
备注
15 pages; 17 figures