GalLoP:学习视觉语言模型的全局和局部提示
计算机视觉与模式识别
2024-12-02 v2
摘要
提示学习已被广泛采用来高效地适应视觉语言模型(如 CLIP),用于few-shot 图像分类。尽管其成功,但大多数提示学习方法在分类准确率和鲁棒性之间进行权衡,例如在域泛化或离群检测(OOD)方面。在本工作中,我们引入了全局-局部提示(GalLoP),这是一种新的提示学习方法,通过利用全局和局部视觉特征学习多个多样化提示。局部提示的训练依赖于增强的视觉-文本对齐。为了仅关注相关特征,该局部对齐结合了稀疏选择局部特征的策略。我们使用新的“提示dropout”技术和局部提示的多尺度策略来强制提示集合具有多样性。GalLoP 在不同 few-shot 设置下使用各种 backbone 的十一个数据集上 outperform 以前的提示学习方法。此外,GalLoP 在域泛化和 OOD 检测方面表现出强大的鲁棒性,甚至超过专门的 OOD 检测方法。代码及复现说明:https://github.com/MarcLafon/gallop。
引用
@article{arxiv.2407.01400,
title = {GalLoP: Learning Global and Local Prompts for Vision-Language Models},
author = {Marc Lafon and Elias Ramzi and Clément Rambour and Nicolas Audebert and Nicolas Thome},
journal= {arXiv preprint arXiv:2407.01400},
year = {2024}
}