中文

扩散模型用于文本到图像生成的实现与实验

计算机视觉与模式识别 2022-09-23 v1 机器学习

摘要

借助深度学习的诸多近期进展,文本到图像生成模型目前具有吸引公众注意力的优点。其中 DALL-E 2 与 Imagen 两个模型已证明可从对图像的简单文本描述生成高度逼真图像。基于一种称为扩散模型的新型图像生成方法,文本到图像模型能够生成多种不同类型的高分辨率图像,仅受人类想象力限制。然而,这些模型训练需要极其大量的计算资源,并处理从互联网收集的海量数据集。此外,其代码库与模型均未发布。这阻碍了 AI 社区对这些前沿模型进行实验,使得重现其结果即便不是不可能也颇为困难。在本论文中,我们旨在通过首先回顾这些模型所使用的不同方法与技巧,然后提出我们自己的文本到图像模型实现来做出贡献。在高度基于 DALL-E 2 的基础上,我们引入了若干轻微修改以应对所引发的高计算成本。因此我们得以进行实验以理解这些模型的能力,尤其在低资源条件下。特别地,我们提供了比 DALL-E 2 作者所做的更为深入额外的分析,包括消融研究。此外,扩散模型使用所谓的引导方法来辅助生成过程。我们引入了一种新的引导方法,可与其他引导方法结合使用以提升图像质量。最后,我们的模型生成的图像质量相当良好,而无需承受最先进文本到图像模型的巨大训练成本。

关键词

引用

@article{arxiv.2209.10948,
  title  = {Implementing and Experimenting with Diffusion Models for Text-to-Image Generation},
  author = {Robin Zbinden},
  journal= {arXiv preprint arXiv:2209.10948},
  year   = {2022}
}

备注

Master's Thesis