通过对抗Sinkhorn注意力引导,迈向可靠扩散采样的前沿
计算机视觉与模式识别
2025-11-12 v1 人工智能
摘要
扩散模型在使用如无条件分类引导(CFG)等引导方法时表现出强大的生成性能,这些方法通过修改采样轨迹来增强输出质量。这些方法通常通过刻意降低另一方面的质量(通常是无条件方面),使用如身份混合或模糊条件等启发式扰动函数来提高目标输出。然而,这些方法缺乏原则性基础,依赖于手动设计的扰动。在本工作中,我们提出了对抗Sinkhorn注意力引导(ASAG),一种新方法,将注意力得分在最优输运的视角下重新解释,通过Sinkhorn算法有意破坏输运成本。与简单地损坏注意力机制不同,ASAG在自注意力层中注入对抗性成本,以减少查询与键之间的像素级相似性。这种刻意的降低削弱了误导性注意力对齐,导致条件和无条件样本质量均得到改善。ASAG在文本到图像扩散中表现出一致的改进,并在IP-Adapter和ControlNet等下游应用中增强了可控性和保真度。该方法轻量级、即插即用,且无需模型重新训练即可提高可靠性。
关键词
引用
@article{arxiv.2511.07499,
title = {Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance},
author = {Kwanyoung Kim},
journal= {arXiv preprint arXiv:2511.07499},
year = {2025}
}
备注
Accepted to AAAI 26