CtrLoRA:一种可扩展且高效的可控图像生成框架
计算机视觉与模式识别
2025-03-04 v2
摘要
近年来,大规模扩散模型在文本到图像(T2I)生成方面取得了令人瞩目的进展。为了进一步为这些T2I模型配备细粒度的空间控制能力,ControlNet等方法引入了一个额外的网络来学习跟随条件图像。然而,对于每一种条件类型,ControlNet都需要在数百万个数据对上独立训练数百个GPU小时,这非常昂贵,使得普通用户难以探索和开发新的条件类型。为了解决这个问题,我们提出了CtrLoRA框架,该框架训练一个基础ControlNet从多个基础条件中学习图像到图像生成的通用知识,同时训练特定于条件的LoRA来捕获每种条件的独特特征。利用我们预训练的基础ControlNet,用户可以轻松地将其适应于新的条件,在大多数场景下,仅需1000个数据对和不到一小时的单GPU训练即可获得令人满意的结果。此外,与ControlNet相比,我们的CtrLoRA将可学习参数减少了90%,显著降低了分发和部署模型权重的门槛。在各种条件类型上的大量实验证明了我们方法的效率和有效性。代码和模型权重将在https://github.com/xyfJASON/ctrlora发布。
引用
@article{arxiv.2410.09400,
title = {CtrLoRA: An Extensible and Efficient Framework for Controllable Image Generation},
author = {Yifeng Xu and Zhenliang He and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2410.09400},
year = {2025}
}
备注
ICLR 2025. Code: https://github.com/xyfJASON/ctrlora