面向视觉-语言模型长尾泛化的聚类感知神经坍缩提示微调
计算机视觉与模式识别
2026-05-13 v1
摘要
提示学习已成为微调预训练视觉-语言模型(VLM)的一种高效替代方案。尽管前景广阔,但当前方法在适应类别不平衡数据集时,仍难以维持尾部类别的可判别性。在这项工作中,我们提出了聚类感知神经坍缩提示微调(CPT),该方法能在不牺牲整体泛化能力的前提下,增强提示微调 VLM 中尾部类别的可判别性。首先,我们通过从预训练 VLM 中挖掘语义分配并将其映射到提示微调特征,设计了一个聚类不变空间。这计算了聚类级别的边界,并将约束限制在局部邻域内,从而减少了对预训练 VLM 全局语义结构的干扰。其次,我们引入了神经坍缩驱动的可判别性优化,包含三个损失函数:文本等角紧框架(ETF)分离损失、类内收敛损失和旋转稳定损失。这些损失函数共同作用,塑造类内几何结构,以实现更好的类间分离和类内对齐。在 11 个多样化数据集上的大量实验表明,CPT 优于最先进的方法,在长尾类别上表现更强,并对未见类别具有良好的泛化能力。
引用
@article{arxiv.2605.11939,
title = {Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models},
author = {Boyang Guo and Liang Li and Lin Peng and Yuhan Gao and Xichun Sheng and Chenggang Yan},
journal= {arXiv preprint arXiv:2605.11939},
year = {2026}
}