中文

基础模型使聚类成为冷启动主动学习的更优初始化

机器学习 2024-03-28 v2 计算机视觉与模式识别

摘要

主动学习旨在在标注预算有限的情况下,从未标注数据集中选择信息量最大的样本进行标注。虽然针对基于初始化模型的后续样本选择已提出了多种方法,但主动学习中不可或缺的阶段——即用于模型冷启动初始化的样本选择——却鲜受关注。大多数先前的研究诉诸于随机采样或朴素聚类。然而,随机采样易于波动,而朴素聚类在处理如成像数据等高维数据时存在收敛速度慢的问题。在这项工作中,我们提出将基础模型与聚类方法相结合,以选择用于冷启动主动学习初始化的样本。基础模型是指那些通过自监督范式在海量数据集上训练,并能够为各种下游任务生成信息丰富且紧凑嵌入的模型。利用这些嵌入替代像素值等原始特征,聚类能够快速收敛并识别出更优的初始样本。为了进行全面比较,我们包含了一个经典的 ImageNet 监督模型以获取嵌入。在图像分类和分割两项临床任务上的实验表明,基于基础模型的聚类能够高效地定位信息丰富的初始样本,从而使模型展现出优于基线方法的性能。我们预计本研究将为未来的冷启动主动学习提供一种有效的范式。

关键词

引用

@article{arxiv.2402.02561,
  title  = {Foundation Model Makes Clustering A Better Initialization For Cold-Start Active Learning},
  author = {Han Yuan and Chuan Hong},
  journal= {arXiv preprint arXiv:2402.02561},
  year   = {2024}
}