中文

基于语义感知微调增强少样本 CLIP

计算机视觉与模式识别 2023-12-08 v3

摘要

从有限的训练样本中学习泛化表示对于在资源匮乏场景下应用深度神经网络至关重要。近来,基于对比语言–图像预训练(CLIP)的方法在少样本自适应任务中展现出有前景的性能。为避免少样本微调引起的灾难性遗忘与过拟合,现有工作通常冻结在大规模数据集上预训练的 CLIP 参数,忽视了某些参数可能并不适合下游任务的可能性。为此,我们以 CLIP 的视觉编码器为重新审视对象,特别关注其独特的注意力池化层,该层对稠密特征图进行空间加权求和。鉴于稠密特征图包含有意义的语义信息,且不同语义对各异的下游任务具有不同重要性(例如在宠物分类任务中优先关注耳朵、眼睛等语义而非侧视镜),对不同少样本任务中的稠密特征使用相同的加权求和操作可能并不恰当。因此,我们提出在训练过程中微调注意力池化层的参数,以促使模型聚焦于任务特定语义。在推理过程中,我们对微调后与原注意力池化层所池化特征进行残差混合,从而融合少样本知识与预训练 CLIP 的先验知识。我们将该方法称为语义感知微调(SAFE)。SAFE 能有效增强常规少样本 CLIP,并与现有适配器方法兼容(称为 SAFE-A)。

关键词

引用

@article{arxiv.2311.04464,
  title  = {Enhancing Few-shot CLIP with Semantic-Aware Fine-Tuning},
  author = {Yao Zhu and Yuefeng Chen and Wei Wang and Xiaofeng Mao and Xiu Yan and Yue Wang and Zhigang Li and Wang lu and Jindong Wang and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2311.04464},
  year   = {2023}
}