中文

Uni-ControlNet:面向文本到图像扩散模型的全能控制

计算机视觉与模式识别 2023-10-31 v3 图形学

摘要

文本到图像扩散模型在过去两年取得了巨大进展,能够基于开放域文本描述生成高度逼真的图像。然而,尽管取得了成功,文本描述往往难以充分传达细致的控制,即便由冗长复杂的文本组成。此外,近期研究也表明这些模型在理解此类复杂文本并生成相应图像方面面临挑战。因此,越来越需要超越文本描述实现更多控制模式。本文中,我们引入Uni-ControlNet,一种统一框架,允许在单一模型内以灵活可组合的方式同时利用不同局部控制(如边缘图、深度图、分割掩码)与全局控制(如CLIP图像嵌入)。与现有方法不同,Uni-ControlNet仅需在冻结的预训练文本到图像扩散模型上微调两个额外适配器,消除了从头训练的巨大成本。此外,得益于一些专门的适配器设计,无论使用多少局部或全局控制,Uni-ControlNet都只需恒定数量(即2)的适配器。这不仅降低了微调成本与模型大小,使其更适于实际部署,也促进了不同条件的可组合性。通过定量与定性比较,Uni-ControlNet在可控性、生成质量和可组合性上均展现出相对于现有方法的优越性。代码见\url{https://github.com/ShihaoZhaoZSH/Uni-ControlNet}。

关键词

引用

@article{arxiv.2305.16322,
  title  = {Uni-ControlNet: All-in-One Control to Text-to-Image Diffusion Models},
  author = {Shihao Zhao and Dongdong Chen and Yen-Chun Chen and Jianmin Bao and Shaozhe Hao and Lu Yuan and Kwan-Yee K. Wong},
  journal= {arXiv preprint arXiv:2305.16322},
  year   = {2023}
}

备注

Camera Ready, Code is available at https://github.com/ShihaoZhaoZSH/Uni-ControlNet