中文

NTKCPL:基于估计真实覆盖率的自我监督模型主动学习

机器学习 2023-06-08 v1

摘要

训练机器学习分类器的高标注成本推动了主动学习与自监督学习的广泛研究。近期研究表明,在监督学习背景下,需在不同训练阶段采用不同主动学习策略,以确保优于随机基线。我们将可用标注数量改变适用主动学习策略的点称为相变点。本文确立,当将主动学习与自监督模型结合以实现性能提升时,相变点出现得更早。这导致难以确定对先前未见过的数据集应使用何种策略。我们认为,现有主动学习算法深受相变影响,因其对这些算法估计的整个主动学习池的经验风险不准确且受标注样本数量影响。为解决此问题,我们提出一种新颖主动学习策略——神经正切核聚类-伪标签(NTKCPL)。其基于伪标签与NTK近似下的模型预测估计经验风险。我们分析了影响该近似误差的因素,并设计了一种伪标签聚类生成方法以降低近似误差。我们在五个数据集上验证了方法,实证表明其在多数情况下优于基线方法,且在更宽训练预算范围内有效。

关键词

引用

@article{arxiv.2306.04099,
  title  = {NTKCPL: Active Learning on Top of Self-Supervised Model by Estimating True Coverage},
  author = {Ziting Wen and Oscar Pizarro and Stefan Williams},
  journal= {arXiv preprint arXiv:2306.04099},
  year   = {2023}
}