利用类别相似性知识学习CLIP的可泛化提示
人工智能
2025-02-18 v1 计算机视觉与模式识别
机器学习
摘要
在视觉-语言模型中,提示调优在适配下游任务方面已展现出有效性。然而,学习到的提示难以泛化到未见类别,因为它们倾向于过拟合提示调优所针对的类别。通过检查失败案例,我们观察到学习到的提示破坏了未见类别的语义,生成具有错误语义关系的文本嵌入。为解决这一问题,我们提出相似性对齐正则化(Similarity Alignment Regularization, SAR),该方法通过正则化可学习提示来保留手工设计提示所捕获的类别间语义关系。具体而言,我们首先利用ChatGPT-4o获取与基础类别相关的新类别,并将其作为提示调优期间的潜在未见类别。然后,通过同时针对基础类别和新类别,SAR将对齐可学习提示生成的文本嵌入之间的相似性关系与手工设计提示的相似性关系。将SAR应用于现有提示调优方法的大量实验证明了其在改善未见类别泛化方面的有效性。
引用
@article{arxiv.2502.11969,
title = {Learning Generalizable Prompt for CLIP with Class Similarity Knowledge},
author = {Sehun Jung and Hyang-won Lee},
journal= {arXiv preprint arXiv:2502.11969},
year = {2025}
}