中文

仅基于正类与未标记数据评估二分类器

机器学习 2015-12-31 v2 信息检索 机器学习

摘要

评估已学习模型的性能是机器学习的关键部分。然而,在某些领域中仅可获得正类与未标记样本,这禁止使用大多数标准评估指标。我们提出一种仅使用正类与未标记数据来估计任何基于列联表的指标(包括ROC与PR曲线)的方法。估计这些性能指标本质上归结为估计未标记集中(潜在)正类的比例,假设已知正类是全部正类的随机样本。我们给出了估计质量的理论界,阐明了估计未标记集中正类比例的重要性,并通过实证证明我们能够在真实数据上可靠地估计ROC与PR曲线。

关键词

引用

@article{arxiv.1504.06837,
  title  = {Assessing binary classifiers using only positive and unlabeled data},
  author = {Marc Claesen and Jesse Davis and Frank De Smet and Bart De Moor},
  journal= {arXiv preprint arXiv:1504.06837},
  year   = {2015}
}

备注

14 pages, 8 figures