中文

Kandinsky 3.0 技术报告

计算机视觉与模式识别 2024-07-01 v3 机器学习 多媒体

摘要

我们提出了 Kandinsky 3.0,这是一个基于潜在扩散的大规模文本到图像生成模型,延续了 Kandinsky 文本到图像模型系列,体现了我们在实现更高质量和更逼真的图像生成方面的进展。在本报告中,我们描述了模型的架构、数据收集流程、训练技术以及用于用户交互的生产系统。我们重点关注那些通过大量实验确定的对提升模型质量影响最显著的关键组件。我们还描述了模型的扩展和应用,包括超分辨率、图像修复、图像编辑、图像到视频生成,以及 Kandinsky 3.0 的蒸馏版本——Kandinsky 3.1,该版本在反向过程的 4 个步骤内进行推理,速度快 20 倍且没有视觉质量下降。通过并排的人类偏好比较,Kandinsky 在文本理解方面变得更好,并且在特定领域表现更佳。代码可在 https://github.com/ai-forever/Kandinsky-3 获取。

关键词

引用

@article{arxiv.2312.03511,
  title  = {Kandinsky 3.0 Technical Report},
  author = {Vladimir Arkhipkin and Andrei Filatov and Viacheslav Vasilev and Anastasia Maltseva and Said Azizov and Igor Pavlov and Julia Agafonova and Andrey Kuznetsov and Denis Dimitrov},
  journal= {arXiv preprint arXiv:2312.03511},
  year   = {2024}
}

备注

Project page: https://ai-forever.github.io/Kandinsky-3