中文

FlexControl:面向文本到图像生成的计算感知 ControlNet 与可微分路由器

机器学习 2025-02-21 v2 图形学

摘要

ControlNet 提供了一种强大的方式来引导基于扩散的生成模型,但大多数实现依赖启发式方法来选择要控制哪些网络块——这种方法会随不同任务而不可预测地变化。为了填补这一空白,我们提出了 FlexControl,一个新颖的框架,在训练期间复制所有扩散块,并采用可训练的门控机制来动态选择每个去噪步骤中激活哪些块。通过引入计算感知的损失函数,我们可以鼓励控制块仅在有利于生成质量时才激活。通过消除手动块选择,FlexControl 增强了跨不同任务的适应性并简化了设计流程,以端到端训练的方式实现了计算感知的训练损失。通过在 UNet(例如 SD1.5)和 DiT(例如 SD3.0)上的全面实验,我们证明了我们的方法在某些关键方面优于现有的 ControlNet 变体。量化和定性评估均表明,FlexControl 在保持或增强图像保真度的同时,还通过选择性激活最相关的块来降低计算开销。这些结果强调了灵活、数据驱动的方法在受控扩散中的潜力,并为高效生成模型设计开辟了新途径。代码将很快发布于 https://github.com/Anonymousuuser/FlexControl。

关键词

引用

@article{arxiv.2502.10451,
  title  = {FlexControl: Computation-Aware ControlNet with Differentiable Router for Text-to-Image Generation},
  author = {Zheng Fang and Lichuan Xiang and Xu Cai and Kaicheng Zhou and Hongkai Wen},
  journal= {arXiv preprint arXiv:2502.10451},
  year   = {2025}
}