中文

ControlNet-XS:将文本到图像扩散模型的控制重新构想为反馈控制系统

计算机视觉与模式识别 2024-08-13 v2

摘要

图像合成领域近年来取得了巨大进步。除了通过文本提示定义期望输出图像外,一种直观的方法是额外使用图像形式的空间引导,例如深度图。在最新方法中,这种引导由一个单独的控制模型实现,该模型控制预训练的生成网络,如潜在扩散模型。从控制系统角度理解这一过程,可以发现它构成了一个反馈控制系统,其中控制模块从生成过程接收反馈信号并发送校正信号。分析现有系统时,我们观察到反馈信号在时间上稀疏且比特数少。因此,新生成的特征与相应的校正信号之间可能存在长延迟。已知这种延迟是任何控制系统中最不期望的方面。在这项工作中,我们采用现有的控制网络(ControlNet)并改变控制网络与生成过程之间的通信,使其具有高频和大带宽。通过这样做,我们能够显著提高生成图像的质量以及控制的保真度。此外,控制网络需要的参数明显更少,因此在推理和训练期间速度大约快两倍。小型模型的另一个好处是它们有助于该领域的民主化,并且可能更容易理解。我们将提出的网络称为ControlNet-XS。与最新方法相比,我们在像素级引导(如深度、Canny边缘和语义分割)上表现更优,在人体姿态的松散关键点引导上表现相当。所有代码和预训练模型将公开发布。

关键词

引用

@article{arxiv.2312.06573,
  title  = {ControlNet-XS: Rethinking the Control of Text-to-Image Diffusion Models as Feedback-Control Systems},
  author = {Denis Zavadski and Johann-Friedrich Feiden and Carsten Rother},
  journal= {arXiv preprint arXiv:2312.06573},
  year   = {2024}
}