中文

克服过度自信以改进主动学习

机器学习 2023-08-22 v1 人工智能

摘要

可以说,人工智能技术近来的进展依赖于大规模高质量数据。同时,一个普遍存在的问题无处不在:数据标注预算受限。主动学习是解决此问题的突出方法,通过模型筛选有价值数据进行标注,并迭代调整模型。然而,由于每轮数据量有限,模型易受偏置影响,从而更可能给出过度自信的预测。本文提出两种新方法解决主动学习场景中的过度自信问题。其一是名为交叉混合再混合(Cross-Mix-and-Mix, CMaM)的增强策略,旨在通过扩展有限训练分布来校准模型。其二是名为排序边界采样(Ranked Margin Sampling, RankedMS)的选择策略,防止选取导致过度自信预测的数据。通过多种实验与分析,我们证明即便易于应用,所提方法也能通过缓解过度自信来促进高效数据筛选。

关键词

引用

@article{arxiv.2308.10571,
  title  = {Overcoming Overconfidence for Active Learning},
  author = {Yujin Hwang and Won Jo and Juyoung Hong and Yukyung Choi},
  journal= {arXiv preprint arXiv:2308.10571},
  year   = {2023}
}