中文

重新审视无分类器扩散引导中的空间不一致性

计算机视觉与模式识别 2024-04-09 v1 人工智能

摘要

无分类器引导 (Classifier-Free Guidance, CFG) 已广泛应用于文本到图像扩散模型中,其中引入 CFG 尺度来控制文本引导在整个图像空间上的强度。然而,我们认为全局 CFG 尺度会导致不同语义强度上的空间不一致以及次优的图像质量。为解决这一问题,我们提出了一种新颖的方法——语义感知无分类器引导 (Semantic-aware Classifier-Free Guidance, S-CFG),以在文本到图像扩散模型中为不同的语义单元定制引导程度。具体而言,我们首先设计了一种无需训练的语义分割方法,在每个去噪步骤将潜在图像划分为相对独立的语义区域。特别地,对去噪 U-net 主干中的交叉注意力图进行重归一化,以将每个图像块分配给对应的 token,同时利用自注意力图来补全语义区域。然后,为平衡不同语义单元的放大效果,我们自适应地调整不同语义区域的 CFG 尺度,将文本引导程度重新缩放至统一水平。最后,大量实验表明,S-CFG 在各种文本到图像扩散模型上均优于原始 CFG 策略,且无需任何额外训练成本。我们的代码可在 https://github.com/SmilesDZgk/S-CFG 获取。

关键词

引用

@article{arxiv.2404.05384,
  title  = {Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance},
  author = {Dazhong Shen and Guanglu Song and Zeyue Xue and Fu-Yun Wang and Yu Liu},
  journal= {arXiv preprint arXiv:2404.05384},
  year   = {2024}
}

备注

accepted by CVPR-2024