ControlNeXt:用于图像和视频生成的强大且高效控制方法
计算机视觉与模式识别
2025-03-11 v3
摘要
扩散模型在图像和视频生成中展现出卓越且稳健的能力。为实现对生成结果的更好控制,研究者引入额外的架构,如ControlNet、Adapter和ReferenceNet,以整合条件控制。然而,当前可控生成方法常需额外的大量计算资源,尤其是视频生成,且面临训练困难或控制效果较弱的问题。本文提出ControlNeXt:一种强大且高效的可控图像和视频生成方法。我们首先设计更简洁且高效的架构,用极少的额外计算量取代底层模型的重型附加分支。这种简洁的结构还使我们的方法能够无缝集成其他LoRA权重,实现无需额外训练即可进行风格调整。就训练而言,我们将可学习参数减少至替代方案的90%以下。此外,我们提出另一种称为Cross Normalization(CN)的 метод,作为Zero-Convolution的替代方案,以实现快速稳定的训练收敛。我们在不同底层模型上进行了针对图像和视频的various实验,证明了我们方法的稳健性。
引用
@article{arxiv.2408.06070,
title = {ControlNeXt: Powerful and Efficient Control for Image and Video Generation},
author = {Bohao Peng and Jian Wang and Yuechen Zhang and Wenbo Li and Ming-Chang Yang and Jiaya Jia},
journal= {arXiv preprint arXiv:2408.06070},
year = {2025}
}
备注
controllable generation