中文

LiteEmbed: 适配稀有类别的CLIP模型

计算机视觉与模式识别 2026-01-15 v1

摘要

大规模视觉语言模型如CLIP在零样态识别方面表现优异,但在处理训练时很少看到的类别(包括新兴实体和文化特定类别)时表现不足。我们引入LiteEmbed,一个轻量级框架,用于few-shot情感CLIP的个性化,使新类别无需重新训练其编码器即可添加。LiteEmbed通过PCA基分解,对CLIP词汇表中的文本嵌入进行次空间引导优化, disentangle粗粒度语义方向与细粒度变化。两个互补目标——粗对齐与细分离——共同保持全局语义一致性,同时增强视觉相似类别的判别性。优化后,嵌入可即插即用,无缝替换CLIP的原始文本特征,适用于分类、检索、分割和检测任务。大量实验表明,LiteEmbed在处理 underrepresented、稀有或未见类别时显著优于先前方法,建立了LiteEmbed作为适配CLIP稀有类别有效方法的地位。

关键词

引用

@article{arxiv.2601.09661,
  title  = {LiteEmbed: Adapting CLIP to Rare Classes},
  author = {Aishwarya Agarwal and Srikrishna Karanam and Vineet Gandhi},
  journal= {arXiv preprint arXiv:2601.09661},
  year   = {2026}
}

备注

14 pages, 12 figures