中文

Ctrl-Adapter:一个将多样化控制适配到任意扩散模型的高效且通用框架

计算机视觉与模式识别 2024-05-27 v2 人工智能 机器学习

摘要

ControlNet 被广泛用于为文本到图像的扩散模型添加空间控制,支持深度图、涂鸦/草图、人体姿态等不同条件。然而,在可控视频生成方面,由于特征空间不匹配,ControlNet 无法直接集成到新的骨干网络中,而为新骨干网络训练 ControlNet 对许多用户来说可能是一个巨大的负担。此外,将 ControlNet 独立应用于不同帧无法有效保持物体的时序一致性。为应对这些挑战,我们引入了 Ctrl-Adapter,这是一个高效且通用的框架,通过适配预训练的 ControlNet,为任意图像/视频扩散模型添加多样化的控制。Ctrl-Adapter 提供了强大且多样化的能力,包括图像和视频控制、稀疏帧视频控制、细粒度块级多条件控制(通过 MoE 路由器)、对未见条件的零样本适配,并支持空间控制之外的多种下游任务,包括视频编辑、视频风格迁移和文本引导的运动控制。通过在六个基于 U-Net/DiT 的多样化图像/视频扩散模型(SDXL、PixArt-α\alpha、I2VGen-XL、SVD、Latte、Hotshot-XL)上的实验,Ctrl-Adapter 在 COCO 上达到了与预训练 ControlNet 相当的性能,并在 DAVIS 2017 上以显著更低的计算成本(< 10 GPU 小时)取得了最先进的结果。

关键词

引用

@article{arxiv.2404.09967,
  title  = {Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model},
  author = {Han Lin and Jaemin Cho and Abhay Zala and Mohit Bansal},
  journal= {arXiv preprint arXiv:2404.09967},
  year   = {2024}
}

备注

First two authors contributed equally; Project page: https://ctrl-adapter.github.io/