通过提示条件化和头部选择解锁 LVLMs 的少样本能力
计算机视觉与模式识别
2026-03-26 v1
摘要
当前的大型视觉语言模型 (LVLMs) 在图像字幕、视觉问答和光学字符识别等众多零样本任务中表现出色。然而,这些模型在图像分类任务上的表现却不佳,甚至不及基于 CLIP 的方法。值得注意的是,因为许多 LVLMs 使用 CLIP 预训练的视觉编码器,这一差距仍显得很意外。然而,LVLMs 并不受限于 CLIP 的架构,其独立的视觉和文本编码器并非根本限制。CLIP 中这种分离会偏向于基于类别名称的匹配,而非联合的视觉-文本推理。在本文中,我们表明尽管其原始性能较差,LVLMs 仍可通过提示条件化改善视觉特征的类别可分离性,而 LVLMs 的内部表示,特别是注意力头部,在零样本和少样本分类中可优于模型本身。我们引入了头部集合分类器 (HEC),以弥合基于 CLIP 和基于 LVLM 的分类方法之间的性能差距。灵感来自高斯判别分析,HEC 对最具辨识力的视觉和文本头部进行排序,并将其组合成一个无训练的分类器。我们展示了 HEC 在 12 个数据集上的少样本和零样本分类中实现了最先进的性能。
引用
@article{arxiv.2603.24181,
title = {Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection},
author = {Adhemar de Senneville and Xavier Bou and Jérémy Anger and Rafael Grompone and Gabriele Facciolo},
journal= {arXiv preprint arXiv:2603.24181},
year = {2026}
}