中文

DynamicControl:用于改进文本到图像生成的自适应条件选择

计算机视觉与模式识别 2025-09-29 v3

摘要

为了提高文本到图像扩散模型的可控性,现有的 ControlNet 类模型已探索 various control signals 来指导图像属性。然而,现有方法要么高效地处理条件,要么使用固定数量的条件,无法充分解决多条件的复杂性以及潜在冲突。这凸显了需要创新方法来有效管理多条件以实现更可靠和详细的图像合成的需求。为此,我们提出了一种新框架 DynamicControl,支持多样化控制信号的动态组合,允许自适应选择不同数量和类型的条件。我们的 approach 从一个 double-cycle controller 开始,通过利用预训练的条件生成模型和判别模型,为所有输入条件生成初始真实评分排序。该 controller 评估提取条件与输入条件之间的相似性,以及与源图像的像素级相似性。随后,我们集成一个多模态大语言模型(MLLM)来构建高效的条件评估器。该评估器根据 double-cycle controller 的评分排序来优化条件的排序。我们的 method 同时优化 MLLMs 和扩散模型,利用 MLLMs 的推理能力来促进多条件文本到图像(T2I)任务。最终的排序条件输入到并行的多控制适配器中,后者从动态视觉条件中学习特征图并将其整合以调制 ControlNet,从而增强对生成图像的控制。通过定性和定量比较,DynamicControl 在 various conditional controls 下在可控性、生成质量和可组合性方面优于现有方法。

关键词

引用

@article{arxiv.2412.03255,
  title  = {DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation},
  author = {Qingdong He and Jinlong Peng and Pengcheng Xu and Boyuan Jiang and Xiaobin Hu and Donghao Luo and Yong Liu and Yabiao Wang and Chengjie Wang and Xiangtai Li and Jiangning Zhang},
  journal= {arXiv preprint arXiv:2412.03255},
  year   = {2025}
}