中文

类别不平衡问题中一种新的无代价学习策略

机器学习 2013-07-23 v1

摘要

在本工作中,我们与代价敏感学习(CSL)相比,形式化地定义了无代价学习(CFL)。它们之间的主要区别在于,CFL 方法寻求最优分类结果而无需任何代价信息,即使在类别不平衡问题中也是如此。事实上,相关研究中已存在几种 CFL 方法,如采样和一些基于准则的方法。然而,据我们所知,现有的 CFL 和 CSL 方法均无法在关于错误和拒绝的信息缺失时正确处理拒绝分类。基于信息论,我们提出了一种新的 CFL 方法,旨在最大化目标与分类器决策输出之间的归一化互信息。利用该策略,我们可以处理带有或不带有拒绝选项的二类/多类分类问题。观察到了该新策略的显著特征。当类别不平衡程度变化时,所提出的策略能够相应地自动平衡错误和拒绝。该策略的另一个优势是能够为拒绝分类推导最优拒绝阈值,并为二类分类推导“等效”代价。我们探讨了拒绝阈值与 ROC 曲线之间的联系。在几个基准数据集上进行了实证研究,并与其他现有方法进行了比较。分类结果表明该策略在机器学习中具有广阔的前景。

关键词

引用

@article{arxiv.1307.5730,
  title  = {A New Strategy of Cost-Free Learning in the Class Imbalance Problem},
  author = {Xiaowan Zhang and Bao-Gang Hu},
  journal= {arXiv preprint arXiv:1307.5730},
  year   = {2013}
}

备注

Classification, class imbalance, cost-free learning, cost-sensitive learning, abstaining, mutual information, ROC