中文

PCoreSet:通过视觉语言模型知识蒸馏实现的有效主动学习

机器学习 2025-10-02 v2 人工智能

摘要

知识蒸馏(KD)是一种广泛使用的框架,通过从教师模型转移知识来训练紧凑的、特定任务的模型。然而,其主动学习(AL)中的应用——旨在通过迭代样本选择最小化标注成本——仍鲜少探索。这一空白源于KD通常假设拥有充足的标注数据,而AL在数据稀缺场景下运行,此时特定任务的教师模型通常不可用。本文首先引入ActiveKD,这是一个利用大型视觉语言模型(VLM)的零样本和少样本能力将AL与KD结合的框架。ActiveKD的关键方面是VLM的结构化预测偏差——即其预测在概率空间中形成聚类。我们将此结构视为教师模型的归纳偏置,捕获对学生学习有益的可泛化输出模式。为利用这一偏差,我们提出概率核心集(PCoreSet),这是一种在概率空间而非特征空间中最大化覆盖的选择策略。PCoreSet策略性地选择概率上多样的未标注样本,在有限标注预算下促进教师知识更高效的转移。在11个数据集上的广泛评估表明,ActiveKD在各种选择方法上持续提升性能(例如,在ImageNet上平均提升29.07%)。在ActiveKD下,PCoreSet在5个学生网络和3个教师网络的73个设置中的64个(约87.7%)排名第一,除前2轮AL外始终取得最佳性能。代码可在https://github.com/erjui/PCoreSet获取。

关键词

引用

@article{arxiv.2506.00910,
  title  = {PCoreSet: Effective Active Learning through Knowledge Distillation from Vision-Language Models},
  author = {Seongjae Kang and Dong Bok Lee and Hyungjoon Jang and Dongseop Kim and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2506.00910},
  year   = {2025}
}

备注

39 pages, 25 figures, preprint