中文

面向视觉语言模型的抗噪少样本无监督适配器

计算机视觉与模式识别 2024-07-31 v3 机器学习

摘要

大规模视觉语言模型的最新进展在各种零样本图像分类任务中取得了令人印象深刻的性能。尽管先前的研究已表明通过引入少样本带标签目标样本可显著改进,但它们仍需要对目标样本进行标注,这在处理各类视觉识别任务时极大地削弱了其可扩展性与泛化能力。我们设计了 NtUA,一种抗噪无监督适配器(Noise-tolerant Unsupervised Adapter),可利用少量无标签目标样本学习有效的目标模型。NtUA 作为一个键值缓存工作,将少量无标签目标样本的视觉特征与预测伪标签构建为键值对。它包含两项互补设计。其一是自适应缓存构建,通过依据预测置信度对键值对加权来对抗伪标签噪声。其二是知识引导的缓存精炼,通过利用来自大规模视觉语言模型的知识蒸馏来精炼对值(即伪标签)与缓存权重。大量实验表明,NtUA 在多个广泛采用的基准上持续取得优越性能。

关键词

引用

@article{arxiv.2309.14928,
  title  = {Noise-Tolerant Few-Shot Unsupervised Adapter for Vision-Language Models},
  author = {Eman Ali and Muhammad Haris Khan},
  journal= {arXiv preprint arXiv:2309.14928},
  year   = {2024}
}

备注

Accepted at BMVC 2024