归一化注意力引导:扩散模型的通用负向引导
计算机视觉与模式识别
2025-06-04 v3
摘要
负向引导——显式抑制不需要的属性——在扩散模型中仍然是一个基本挑战,尤其是在少步采样机制下。虽然无分类器引导(CFG)在标准设置下表现良好,但由于正向分支和负向分支之间的预测发散,在激进的采样步数压缩下会失效。我们提出了归一化注意力引导(NAG),这是一种高效、免训练的机制,在注意力空间中应用外推,并结合基于L1的归一化与精炼。NAG在CFG失效之处恢复了有效的负向引导,同时保持保真度。与现有方法不同,NAG可泛化于不同架构(UNet、DiT)、采样机制(少步、多步)和模态(图像、视频),作为一种通用插件运行,且计算开销极小。通过大量实验,我们在文本对齐(CLIP Score)、保真度(FID、PFID)和人类感知质量(ImageReward)方面展示了一致的提升。我们的消融研究验证了每个设计组件,而用户研究证实了对NAG引导输出的显著偏好。作为一种无需重训练的模型无关推理时方法,NAG为所有现代扩散框架提供了轻松的负向引导——附录中附有伪代码!
引用
@article{arxiv.2505.21179,
title = {Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models},
author = {Dar-Yen Chen and Hmrishav Bandyopadhyay and Kai Zou and Yi-Zhe Song},
journal= {arXiv preprint arXiv:2505.21179},
year = {2025}
}