中文

CommonCanvas:使用知识共享图像训练的开放扩散模型

计算机视觉与模式识别 2023-10-26 v1 计算机与社会

摘要

我们整理了一个知识共享(CC)许可图像的数据集,并用以训练一组在质量上可与 Stable Diffusion 2(SD2)竞争的开放扩散模型。该任务面临两个挑战:(1)高分辨率 CC 图像缺乏训练文本到图像生成模型所需的描述;(2)CC 图像相对稀缺。为此,为应对这些挑战,我们使用一种直观的迁移学习技术来生成一组与精选 CC 图像配对的高质量合成描述。随后我们开发了一种数据和计算高效的训练方案,仅需训练现有 SD2 模型所需 LAION-2B 数据的 3%,却可获得相当的质量。这些结果表明,我们拥有足够数量的 CC 图像(约 7000 万张)来训练高质量模型。我们的训练方案还实现了多种优化,获得了约 3 倍的训练加速,从而支持快速的模型迭代。我们利用该方案训练了多个高质量的文本到图像模型,称之为 CommonCanvas 系列。尽管我们的 CC 数据集远小于 LAION 且使用合成描述进行训练,我们最大的模型在人工评估中取得了与 SD2 相当的性能。我们在 https://github.com/mosaicml/diffusion/blob/main/assets/common-canvas.md 发布了我们的模型、数据和代码。

关键词

引用

@article{arxiv.2310.16825,
  title  = {CommonCanvas: An Open Diffusion Model Trained with Creative-Commons Images},
  author = {Aaron Gokaslan and A. Feder Cooper and Jasmine Collins and Landan Seguin and Austin Jacobson and Mihir Patel and Jonathan Frankle and Cory Stephenson and Volodymyr Kuleshov},
  journal= {arXiv preprint arXiv:2310.16825},
  year   = {2023}
}