中文

SemanticControl:一种处理 ControlNet 中松散对齐视觉条件的免训练方法

计算机视觉与模式识别 2025-09-29 v1 人工智能

摘要

ControlNet 通过引入深度图或边缘图等额外视觉条件,实现了对文本到图像扩散模型的精细空间控制。然而,其有效性严重依赖于是否存在与文本提示指定的生成目标精确对齐的视觉条件——这一要求在实践中常常无法满足,尤其是对于罕见或富有想象力的场景。例如,生成特定姿态下烹饪的猫的图像,可能因缺乏合适的视觉条件而无法实现。相比之下,结构相似的线索通常可以在更常见的场景中找到——例如,人类烹饪的姿态广泛存在,可以作为粗略的视觉引导。遗憾的是,现有的 ControlNet 模型难以利用此类松散对齐的视觉条件,往往导致文本保真度低或产生视觉伪影。为解决这一局限性,我们提出了 SemanticControl,一种免训练方法,能够有效利用未对齐但语义相关的视觉条件。我们的方法在视觉条件与提示冲突时自适应地抑制其影响,同时增强来自文本的引导。其核心思想是,首先使用与视觉条件对齐的代理提示(例如,针对人体姿态条件使用“人类弹吉他”)运行辅助去噪过程,以提取信息丰富的注意力掩码,然后在真实目标提示(例如,猫弹吉他)的去噪过程中利用这些掩码。实验结果表明,我们的方法在深度图、边缘图和人体骨架等多种松散对齐条件下均提升了性能,优于现有基线方法。我们的代码可在 https://mung3477.github.io/semantic-control 获取。

关键词

引用

@article{arxiv.2509.21938,
  title  = {SemanticControl: A Training-Free Approach for Handling Loosely Aligned Visual Conditions in ControlNet},
  author = {Woosung Joung and Daewon Chae and Jinkyu Kim},
  journal= {arXiv preprint arXiv:2509.21938},
  year   = {2025}
}

备注

BMVC 2025