注意力头净化:一种全新视角借助CLIP实现域间泛化
计算机视觉与模式识别
2024-12-11 v1
摘要
域间泛化(DG)旨在从多个源域学习模型,以实现对不可见目标域的满意性能。近期工作因其卓越的图像-文本对齐和零样性能力而将CLIP引入DG任务。以往方法要么利用完整微调,要么采用prompt-learning范式来利用CLIP进行DG任务。这些工作侧重于避免原始CLIP编码知识的灾难性遗忘,但忽略了CLIP本质中可能包含的域特定线索,这些线索限制了其域间泛化性能。在本文中,我们提出了一种全新的视角来利用CLIP进行DG,即注意力头净化。我们观察到不同的注意力头可能编码图像的不同属性,合适地选择注意力头可能在跨域上实现显著的性能提升。在此基础上,我们从两个层面净化CLIP的注意力头,包括任务级净化和域级净化。对于任务级净化,我们设计head-aware LoRA,使每个注意力头更适应我们考虑的任务。对于域级净化,我们通过简单的gating策略进行注意力头选择。我们利用MMD损失鼓励被掩码注意力头特征更具域不变性,以强调更具可泛化性的特征/注意力头。在训练期间,我们联合执行任务级净化和域级净化。我们在各种代表性DG基准上进行了实验。尽管方法简单,但广泛的实验表明,我们的方法在先前最先进方法面前表现出色。
引用
@article{arxiv.2412.07226,
title = {Attention Head Purification: A New Perspective to Harness CLIP for Domain Generalization},
author = {Yingfan Wang and Guoliang Kang},
journal= {arXiv preprint arXiv:2412.07226},
year = {2024}
}