面向少样本视觉语言模型适应的辅助描述性知识
计算机视觉与模式识别
2025-12-22 v1
摘要
尽管视觉语言模型(VLM)在零样情境下表现出惊人的能力,但在分布偏移于预训练数据之外的下游任务中常常感到挑战。少样本适应(Few-Shot Adaptation, FSA-VLM)已成为关键解决方案,通常使用参数高效微调(PEFT)以最小数据适配模型。然而,这些PEFT方法受限于其对固定、手工提示的依赖,这些提示往往不足以理解类的语义。虽然一些研究提出利用图像诱导提示为分类提供额外线索,但在推理时引入巨大的计算开销。因此,我们提出了辅助描述性知识(Auxiliary Descriptive Knowledge, ADK),一种高效丰富文本表示而不牺牲效率的框架。ADK 首先利用大语言模型为每个类生成丰富的描述性提示集合,这些预计算特征随后以两种方式部署:(1)作为组合知识,提供平均表示,尤其在类名对VLM而言含义模糊或陌生时尤为有益;(2)作为实例特定知识,通过轻量级、非参数化注意力机制动态选择与给定图像最相关的描述。该方法为手工提示之外的两种额外知识类型,促进了各种领域中的类别区分。ADK 作为无参数、即插即用组件,增强了现有PEFT方法。广泛的实验表明,ADK 在多个PEFT基线上一致提升性能,在各种场景中树立了新的主导水平。
引用
@article{arxiv.2512.17313,
title = {Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model},
author = {SuBeen Lee and GilHan Park and WonJun Moon and Hyun Seok Seong and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2512.17313},
year = {2025}
}