并非所有扩散模型激活都已被评估为判别特征
计算机视觉与模式识别
2024-10-21 v3 人工智能
摘要
扩散模型最初用于图像生成。近期研究表明,其内部信号(称为激活)也可 serve as 各种判别任务的稠密特征,如语义分割等。鉴于大量激活,从中筛选出少量高效子集构成根本问题。为此,早期研究对激活的判别能力进行大规模定量比较。然而,我们发现许多潜在激活尚未被评估,例如用于计算注意力得分的查询和键。此外,近期的扩散架构进展带来了许多新型激活,如嵌入式 ViT 模块中的激活。综上所述,激活选择仍是未被充分解决且被忽视的问题。为此,本文采取更广泛的激活范围进行评估。鉴于激活数量的显著增加,全规模定量比较已不再可行。相反,我们寻求理解这些激活的特性,以便通过简单的定性评估提前筛选出明显劣势的激活。在深入分析后,我们发现扩散模型中存在三大普适属性,使本研究得以超越特定模型。基于此,我们为几类流行扩散模型提供了有效的特征选择解决方案。最终,跨多个判别任务的实验验证了我们方法优于 SOTA 竞争者的优势。我们的代码已公开于 https://github.com/Darkbblue/generic-diffusion-feature。
引用
@article{arxiv.2410.03558,
title = {Not All Diffusion Model Activations Have Been Evaluated as Discriminative Features},
author = {Benyuan Meng and Qianqian Xu and Zitai Wang and Xiaochun Cao and Qingming Huang},
journal= {arXiv preprint arXiv:2410.03558},
year = {2024}
}