Kandinsky 3:面向多功能生成式框架的文本到图像合成
计算机视觉与模式识别
2024-10-29 v1 人工智能
多媒体
摘要
文本到图像(T2I)扩散模型因引入图像编辑、图像融合、图像修复等图像处理方法而广受欢迎。同时,图像到视频(I2V)和文本到视频(T2V)模型也建立在 T2I 模型之上。我们提出了 Kandinsky 3,一种基于潜在扩散的新型 T2I 模型,实现了高质量和照片级真实感。该新架构的关键特点是其适应多种生成任务的简洁性和高效性。我们扩展了基础 T2I 模型以用于各种应用,并创建了一个多功能生成系统,包括文本引导的图像修复/外扩、图像融合、文本-图像融合、图像变体生成、I2V 和 T2V 生成。我们还提出了 T2I 模型的蒸馏版本,在逆向过程的 4 步内评估推理,不降低图像质量,且速度比基础模型快 3 倍。我们部署了一个用户友好的演示系统,所有功能均可在公共领域进行测试。此外,我们发布了 Kandinsky 3 及扩展模型的源代码和检查点。人工评估表明,Kandinsky 3 在开源生成系统中展示了最高的质量得分之一。
引用
@article{arxiv.2410.21061,
title = {Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework},
author = {Vladimir Arkhipkin and Viacheslav Vasilev and Andrei Filatov and Igor Pavlov and Julia Agafonova and Nikolai Gerasimenko and Anna Averchenkova and Evelina Mironova and Anton Bukashkin and Konstantin Kulikov and Andrey Kuznetsov and Denis Dimitrov},
journal= {arXiv preprint arXiv:2410.21061},
year = {2024}
}
备注
Accepted for EMNLP 2024 (Demo track)