中文

为文本到图像扩散模型添加条件控制

计算机视觉与模式识别 2023-11-28 v3 人工智能 图形学 人机交互 多媒体

摘要

我们提出 ControlNet,一种用于向大型预训练文本到图像扩散模型添加空间条件控制的神经网络架构。ControlNet 锁定可投产的大型扩散模型,并重用其以数十亿图像预训练的深层鲁棒编码层作为强大骨干来学习多样化的条件控制。该神经架构通过“零卷积”(零初始化的卷积层)连接,这些层从零逐步增长参数并确保无有害噪声影响微调。我们使用 Stable Diffusion 测试了多种条件控制,例如边缘、深度、分割、人体姿态等,采用单条件或多条件、带提示或不带提示。我们表明 ControlNet 的训练在小型(<50k)和大型(>1m)数据集上均具有鲁棒性。广泛的结果表明 ControlNet 可促进图像扩散模型控制更广泛的应用。

关键词

引用

@article{arxiv.2302.05543,
  title  = {Adding Conditional Control to Text-to-Image Diffusion Models},
  author = {Lvmin Zhang and Anyi Rao and Maneesh Agrawala},
  journal= {arXiv preprint arXiv:2302.05543},
  year   = {2023}
}

备注

Codes and Supplementary Material: https://github.com/lllyasviel/ControlNet