Ctrl-Adapter:一个将多样化控制适配到任意扩散模型的高效且通用框架
计算机视觉与模式识别
2024-05-27 v2 人工智能
机器学习
摘要
ControlNet 被广泛用于为文本到图像的扩散模型添加空间控制,支持深度图、涂鸦/草图、人体姿态等不同条件。然而,在可控视频生成方面,由于特征空间不匹配,ControlNet 无法直接集成到新的骨干网络中,而为新骨干网络训练 ControlNet 对许多用户来说可能是一个巨大的负担。此外,将 ControlNet 独立应用于不同帧无法有效保持物体的时序一致性。为应对这些挑战,我们引入了 Ctrl-Adapter,这是一个高效且通用的框架,通过适配预训练的 ControlNet,为任意图像/视频扩散模型添加多样化的控制。Ctrl-Adapter 提供了强大且多样化的能力,包括图像和视频控制、稀疏帧视频控制、细粒度块级多条件控制(通过 MoE 路由器)、对未见条件的零样本适配,并支持空间控制之外的多种下游任务,包括视频编辑、视频风格迁移和文本引导的运动控制。通过在六个基于 U-Net/DiT 的多样化图像/视频扩散模型(SDXL、PixArt-、I2VGen-XL、SVD、Latte、Hotshot-XL)上的实验,Ctrl-Adapter 在 COCO 上达到了与预训练 ControlNet 相当的性能,并在 DAVIS 2017 上以显著更低的计算成本(< 10 GPU 小时)取得了最先进的结果。
引用
@article{arxiv.2404.09967,
title = {Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model},
author = {Han Lin and Jaemin Cho and Abhay Zala and Mohit Bansal},
journal= {arXiv preprint arXiv:2404.09967},
year = {2024}
}
备注
First two authors contributed equally; Project page: https://ctrl-adapter.github.io/