使用钟形曲线权重函数改进不确定性采样
机器学习
2024-03-05 v1
摘要
通常,监督学习模型通过被动学习进行训练,即随机选择未标记的实例进行标注。这种方法对于学习模型是有效的,但在获取标记实例成本高昂的情况下可能代价很大。例如,在初始数据收集时,从涌入收件箱的数千封邮件(未标记实例)中手动识别垃圾邮件(标记实例)非常耗时。通常,我们通过不确定性采样来应对上述情况,这是一种主动学习方法,通过使用比被动学习更少的标记实例来提高监督学习的效率。给定一个未标记的数据池,不确定性采样会查询那些预测概率p落在不确定性区域(即p≈0.5)的实例的标签。新获取的标签随后被添加到现有的标记数据池中,以学习新的模型。然而,不确定性采样的性能容易受到不可预测响应区域(AUR)和数据集性质的影响。在没有新数据集先验知识的情况下,很难确定是使用被动学习还是不确定性采样。为了解决这个问题,我们提出了钟形曲线采样,它使用钟形曲线权重函数来获取新的标签。钟形曲线以p=0.5为中心,钟形曲线采样在大多数情况下会选择预测值在不确定性区域的实例,同时也不忽略其余部分。仿真结果表明,在大多数情况下,钟形曲线采样在不同性质和具有AUR的数据集上均优于不确定性采样和被动学习。
引用
@article{arxiv.2403.01352,
title = {Improving Uncertainty Sampling with Bell Curve Weight Function},
author = {Zan-Kai Chong and Hiroyuki Ohsaki and Bok-Min Goi},
journal= {arXiv preprint arXiv:2403.01352},
year = {2024}
}
备注
9 pages, 9 figures, journal