中文

有限标注资源下的分类器风险估计

机器学习 2018-02-21 v2 应用统计 机器学习

摘要

本文提出了在无法为整个测试集获取标签时估计分类器性能的策略。与整个测试数据集大小相比,可标注的测试实例数量非常少。因此,目标是使用尽可能少的标注资源来获得分类器性能的精确估计。具体而言,我们试图回答:如何从大型测试集中选择一个子集进行标注,使得在该子集上估计的分类器性能尽可能接近在整个测试集上的性能。我们提出了基于分层抽样的策略来选择该子集。我们表明,与简单随机抽样相比,这些策略可以将分类器准确率估计的方差显著降低(在多种情况下超过 65%)。因此,在受限的标注资源下,我们提出的方法在准确率估计方面比随机抽样精确得多。在某些情况下,为了以仅 1% 的误差估计分类器准确率,所需样本数量的减少(相比于随机抽样)高达 60%。

关键词

引用

@article{arxiv.1607.02665,
  title  = {Classifier Risk Estimation under Limited Labeling Resources},
  author = {Anurag Kumar and Bhiksha Raj},
  journal= {arXiv preprint arXiv:1607.02665},
  year   = {2018}
}

备注

PAKDD 2018