中文

魔鬼在少数样本中:面向少样本学习的迭代视觉知识补全

计算机视觉与模式识别 2024-04-22 v2

摘要

对比语言-图像预训练 (CLIP) 展现了强大的零样本学习性能。少样本学习旨在通过为每个类别提供少量图像(即“few shots”),进一步增强 CLIP 的迁移能力。现有大多数方法要么通过结合可学习的提示或适配器从少样本中隐式学习,要么将它们显式嵌入缓存模型中进行推理。然而,少样本的狭窄分布通常包含不完整的类别信息,导致视觉知识存在偏差且误分类风险较高。为了解决这个问题,最近的方法提出通过生成模型或额外数据库来补充视觉知识,但这可能既昂贵又耗时。在本文中,我们提出了一种迭代视觉知识补全 (KCL) 方法,通过适当利用未标记样本且不访问任何辅助或合成数据来补充视觉知识。具体而言,KCL 首先测量未标记样本与每个类别之间的相似度。然后,通过设计的置信度准则,选择并收集每个类别置信度最高的样本。最后,将收集到的样本视为有标记样本并加入少样本中,以共同重新估计剩余的未标记样本。上述过程将重复一定次数的迭代,随着越来越多的样本被收集直至收敛,确保了一个渐进且稳健的知识补全过程。在 11 个基准数据集上的广泛实验表明,KCL 作为即插即用模块在少样本和零样本学习设置下均有效且高效。代码可在 https://github.com/Mark-Sky/KCL 获取。

关键词

引用

@article{arxiv.2404.09778,
  title  = {The Devil is in the Few Shots: Iterative Visual Knowledge Completion for Few-shot Learning},
  author = {Yaohui Li and Qifeng Zhou and Haoxing Chen and Jianbing Zhang and Xinyu Dai and Hao Zhou},
  journal= {arXiv preprint arXiv:2404.09778},
  year   = {2024}
}