中文

RichControl:用于文本到图像生成的富含结构与外观的免训练空间控制

计算机视觉与模式识别 2025-11-25 v4

摘要

文本到图像(T2I)扩散模型在根据文本提示生成高质量图像方面取得了显著成功。最近的工作将这些模型扩展到包含条件图像(例如,canny边缘)以实现细粒度的空间控制。其中,特征注入方法已成为传统基于微调方法的免训练替代方案。然而,它们常常遭受结构错位、条件泄漏和视觉伪影的困扰,特别是当条件图像与自然RGB分布显著偏离时。通过对现有方法的实证分析,我们识别出一个关键限制:条件特征的采样调度(此前未被探索)未能考虑扩散步骤中结构保持与域对齐之间不断演变的相互作用。受此观察启发,我们提出了一个灵活的免训练框架,该框架将条件特征的采样调度与去噪过程解耦,并系统地研究了特征注入调度的谱系,以在特征空间中实现更高质量的结构引导。具体来说,我们发现从单个时间步采样的条件特征就足够了,从而产生了一个简单而高效的调度,平衡了结构对齐和外观质量。我们通过引入重启细化调度进一步增强了采样过程,并通过富含外观的提示策略提高了视觉质量。这些设计共同实现了既富含结构又富含外观的免训练生成。大量实验表明,我们的方法在多种零样本条件生成场景中达到了最先进的结果。

关键词

引用

@article{arxiv.2507.02792,
  title  = {RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation},
  author = {Liheng Zhang and Lexi Pang and Hang Ye and Xiaoxuan Ma and Yizhou Wang},
  journal= {arXiv preprint arXiv:2507.02792},
  year   = {2025}
}