中文

FreeControl:基于单步注意力提取的高效无训练结构控制

计算机视觉与模式识别 2025-11-10 v1

摘要

控制扩散生成图像的空间与语义结构仍是一个挑战。现有方法如 ControlNet 依赖手工制作的条件图和重新训练,限制了灵活性和泛化能力。基于反转的方法提供更强的对齐,但由于双路径去噪导致高推理成本。我们提出 FreeControl,一个用于扩散模型语义结构控制的无训练框架。不同于先前方法在多个时间步提取注意力,FreeControl 从单个最佳选择的关键时间步进行一次注意力提取,并在整个去噪过程中重用它。这使得在无需反转或重新训练的情况下实现高效的结构引导。为进一步提高质量和稳定性,我们引入潜在条件解耦 (LCD):对关键时间步和用于注意力提取的加噪潜在变量进行原则性分离。LCD 提供更细致的注意力质量控制,消除结构性artifact。FreeControl 还支持通过来自多个来源的参考图像实现组合控制——实现直观的场景布局设计和更强的提示对齐。FreeControl 引入一种新的推理时控制范式,使结构和语义对齐、视觉连贯的生成可直接从原始图像完成,同时具有直观的组合设计灵活性,并与现代扩散模型兼容,额外成本约为 5 百分之一。

关键词

引用

@article{arxiv.2511.05219,
  title  = {FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction},
  author = {Jiang Lin and Xinyu Chen and Song Wu and Zhiqiu Zhang and Jizhi Zhang and Ye Wang and Qiang Tang and Qian Wang and Jian Yang and Zili Yi},
  journal= {arXiv preprint arXiv:2511.05219},
  year   = {2025}
}

备注

Accepted by NIPS 2025