让训练免费扩散分段器的扩张能力实现规模化
计算机视觉与模式识别
2026-03-30 v3
摘要
作为强大的生成模型,文本到图像扩散模型最近被用于探索判别性任务。一系列研究聚焦于无需进一步训练地将预训练扩散模型适用于语义分割,导致训练免费的扩散分段器。这些方法通常依赖于模型注意力层中的交叉注意力图,假设它们捕获了图像像素与文本标记之间的语义关系。理想情况下,这些方法应能从更强大的扩散模型中受益,即更强的生成能力应导致更好的分割。然而,我们注意到现有方法往往未能按预期规模化。为理解此问题,我们识别出两个根本性差距:(i) 交叉注意力在多个注意力头和层之间计算,但这些单个注意力图与统一全局表示之间存在差异。(ii) 即使存在全局图,它也不直接转化为准确的语义关联,用于分割,由于不同文本标记之间的得分不平衡。为弥合这些差距,我们提出两种技术:自动聚合和逐像素重新加权,这两种技术共同使训练免费的分割能够更好地利用生成能力。我们在标准语义分割基准上评估了方法,并进一步将其集成到生成技术中,显示出 improved performance 和 broad applicability。代码请参见 https://github.com/Darkbblue/goca。
引用
@article{arxiv.2603.06178,
title = {Making Training-Free Diffusion Segmentors Scale with the Generative Power},
author = {Benyuan Meng and Qianqian Xu and Zitai Wang and Xiaochun Cao and Longtao Huang and Qingming Huang},
journal= {arXiv preprint arXiv:2603.06178},
year = {2026}
}
备注
Accepted to CVPR 2026