基于期望误差缩减的主动学习
机器学习
2022-11-18 v1
摘要
主动学习作为一种高效的数据收集方法已被广泛研究。在文献中的众多方法中,期望误差缩减(Expected Error Reduction, EER)(Roy 和 McCallum)已被证明是一种有效的主动学习方法:选择期望上能最大程度降低未标记集上误差的候选样本。然而,EER 需要针对每个候选样本重新训练模型,因此由于巨大的计算成本,并未在现代深度神经网络中得到广泛应用。在本文中,我们从贝叶斯主动学习的视角重新表述 EER,并推导出一个计算高效的版本,该版本可使用任意贝叶斯参数采样方法(如 arXiv:1506.02142)。然后,我们使用蒙特卡洛 dropout 进行参数采样,将我们方法的经验性能与深度主动学习文献中的最先进方法进行比较。实验在四个标准基准数据集和三个 WILDS 数据集(arXiv:2012.07421)上进行。结果表明,在数据偏移场景下,我们的方法优于除一种方法之外的所有其他方法:一种模型依赖的、非信息论的方法,其需要高一个数量级的计算成本(arXiv:1906.03671)。
引用
@article{arxiv.2211.09283,
title = {Active Learning with Expected Error Reduction},
author = {Stephen Mussmann and Julia Reisler and Daniel Tsai and Ehsan Mousavi and Shayne O'Brien and Moises Goldszmidt},
journal= {arXiv preprint arXiv:2211.09283},
year = {2022}
}