中文

ControlNeXt:用于图像和视频生成的强大且高效控制方法

计算机视觉与模式识别 2025-03-11 v3

摘要

扩散模型在图像和视频生成中展现出卓越且稳健的能力。为实现对生成结果的更好控制,研究者引入额外的架构,如ControlNet、Adapter和ReferenceNet,以整合条件控制。然而,当前可控生成方法常需额外的大量计算资源,尤其是视频生成,且面临训练困难或控制效果较弱的问题。本文提出ControlNeXt:一种强大且高效的可控图像和视频生成方法。我们首先设计更简洁且高效的架构,用极少的额外计算量取代底层模型的重型附加分支。这种简洁的结构还使我们的方法能够无缝集成其他LoRA权重,实现无需额外训练即可进行风格调整。就训练而言,我们将可学习参数减少至替代方案的90%以下。此外,我们提出另一种称为Cross Normalization(CN)的 метод,作为Zero-Convolution的替代方案,以实现快速稳定的训练收敛。我们在不同底层模型上进行了针对图像和视频的various实验,证明了我们方法的稳健性。

关键词

引用

@article{arxiv.2408.06070,
  title  = {ControlNeXt: Powerful and Efficient Control for Image and Video Generation},
  author = {Bohao Peng and Jian Wang and Yuechen Zhang and Wenbo Li and Ming-Chang Yang and Jiaya Jia},
  journal= {arXiv preprint arXiv:2408.06070},
  year   = {2025}
}

备注

controllable generation