基于簇类的少样本视觉语言模型适应的聚类感知提示集合学习
计算机视觉与模式识别
2025-10-14 v1
摘要
视觉语言模型 (VLM) 如 CLIP 通过在大量图像-文本对上进行预训练,实现跨各种任务的零样迁移。这些模型通常受益于使用多个上下文提示来表示一个类别。尽管有效,但常规的提示集合方法通过对上下文提示的文本特征进行平均会导致结果次优。这是因为特征平均会将类心偏离真实的类分布。为解决此问题,我们提出了 Cluster-Aware Prompt Ensemble Learning (CAPEL) 框架,该框架保留了上下文提示的簇结构。CAPEL 将图像分类到多个类簇中的一个,每个类簇由不同的提示表示。我们在分类逻辑空间内进行提示集合,而非在特征空间内进行,从而更好地与视觉特征分布一致。为进一步优化提示微调,同时保持类簇特定的判别性,我们引入了一个保持类簇的正则化项。这确保了提示保持独特性和针对不同类簇的专业性,防止在统一方向上坍缩。此外,我们集成了自适应提示加权技术,以动态调整对错误或模糊提示的注意力权重,确保在多样化的数据集和任务中获得稳健的性能。
引用
@article{arxiv.2510.09867,
title = {Cluster-Aware Prompt Ensemble Learning for Few-Shot Vision-Language Model Adaptation},
author = {Zhi Chen and Xin Yu and Xiaohui Tao and Yan Li and Zi Huang},
journal= {arXiv preprint arXiv:2510.09867},
year = {2025}
}
备注
Accepted to the journal Pattern Recognition in 2025