Taiyi-Diffusion-XL:在大视觉-语言模型支持下推进双语文本到图像生成
计算与语言
2024-06-19 v3
摘要
文本到图像模型的最新进展显著增强了图像生成能力,然而开源模型在双语或中文支持方面仍存在明显差距。为了满足这一需求,我们提出了 Taiyi-Diffusion-XL,这是一种新的中英双语文本到图像模型,通过双语连续预训练过程扩展了 CLIP 和 Stable-Diffusion-XL 的能力。该方法包括通过将最常用的中文字符集成到 CLIP 的分词器和嵌入层中,并结合绝对位置编码扩展,来高效扩展词汇量。此外,我们利用大型视觉-语言模型丰富了文本提示,从而获得更好的图像描述并具有更高的视觉质量。这些增强随后被应用于下游的文本到图像模型。我们的实证结果表明,所开发的 CLIP 模型在双语图像-文本检索中表现出色。此外,Taiyi-Diffusion-XL 的双语图像生成能力超越了以往的模型。这项研究促成了 Taiyi-Diffusion-XL 模型的开发和开源,代表了图像生成领域,特别是中文应用方面的一个显著进步。这一贡献是解决多模态研究中更多样化语言支持需求的重要一步。模型和演示已在 \href{https://huggingface.co/IDEA-CCNL/Taiyi-Stable-Diffusion-XL-3.5B/} 上公开提供,以促进该领域的进一步研究与合作。
引用
@article{arxiv.2401.14688,
title = {Taiyi-Diffusion-XL: Advancing Bilingual Text-to-Image Generation with Large Vision-Language Model Support},
author = {Xiaojun Wu and Dixiang Zhang and Ruyi Gan and Junyu Lu and Ziwei Wu and Renliang Sun and Jiaxing Zhang and Pingjian Zhang and Yan Song},
journal= {arXiv preprint arXiv:2401.14688},
year = {2024}
}
备注
Taiyi-Diffusion-XL Tech Report