中文

UniControl:一种用于野外可控视觉生成的统一扩散模型

计算机视觉与模式识别 2023-11-03 v3 人工智能

摘要

实现机器自主性与人类控制在交互式 AI 系统的设计中往往代表相互背离的目标。诸如 Stable Diffusion 之类的视觉生成基础模型在平衡这些目标方面展现出前景,尤其是在以任意语言提示时。然而,它们在生成具有空间、结构或几何控制的图像时常常力有不逮。此类控制的集成——可在单一统一模型中适配各种视觉条件——仍是一项未被解决的挑战。为此,我们提出 UniControl,一种新的生成基础模型,将广泛的可控条件到图像(C2I)任务整合于单一框架内,同时仍允许任意语言提示。UniControl 支持像素级精确的图像生成,其中视觉条件主要影响所生成的结构,而语言提示引导风格与上下文。为使 UniControl 具备处理多样视觉条件的能力,我们扩充了预训练的文本到图像扩散模型,并引入任务感知的 HyperNet 来调制扩散模型,从而实现针对不同 C2I 任务的同步适配。在九项独特 C2I 任务上训练后,UniControl 对未见过的视觉条件展现出令人印象深刻的零样本生成能力。实验结果表明,UniControl 常超越同等模型规模的单任务控制方法的性能。这种控制通用性使 UniControl 成为可控视觉生成领域的重要进展。

关键词

引用

@article{arxiv.2305.11147,
  title  = {UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild},
  author = {Can Qin and Shu Zhang and Ning Yu and Yihao Feng and Xinyi Yang and Yingbo Zhou and Huan Wang and Juan Carlos Niebles and Caiming Xiong and Silvio Savarese and Stefano Ermon and Yun Fu and Ran Xu},
  journal= {arXiv preprint arXiv:2305.11147},
  year   = {2023}
}

备注

NeurIPS 2023