类别不平衡问题中一种新的无代价学习策略
机器学习
2013-07-23 v1
摘要
在本工作中,我们与代价敏感学习(CSL)相比,形式化地定义了无代价学习(CFL)。它们之间的主要区别在于,CFL 方法寻求最优分类结果而无需任何代价信息,即使在类别不平衡问题中也是如此。事实上,相关研究中已存在几种 CFL 方法,如采样和一些基于准则的方法。然而,据我们所知,现有的 CFL 和 CSL 方法均无法在关于错误和拒绝的信息缺失时正确处理拒绝分类。基于信息论,我们提出了一种新的 CFL 方法,旨在最大化目标与分类器决策输出之间的归一化互信息。利用该策略,我们可以处理带有或不带有拒绝选项的二类/多类分类问题。观察到了该新策略的显著特征。当类别不平衡程度变化时,所提出的策略能够相应地自动平衡错误和拒绝。该策略的另一个优势是能够为拒绝分类推导最优拒绝阈值,并为二类分类推导“等效”代价。我们探讨了拒绝阈值与 ROC 曲线之间的联系。在几个基准数据集上进行了实证研究,并与其他现有方法进行了比较。分类结果表明该策略在机器学习中具有广阔的前景。
引用
@article{arxiv.1307.5730,
title = {A New Strategy of Cost-Free Learning in the Class Imbalance Problem},
author = {Xiaowan Zhang and Bao-Gang Hu},
journal= {arXiv preprint arXiv:1307.5730},
year = {2013}
}
备注
Classification, class imbalance, cost-free learning, cost-sensitive learning, abstaining, mutual information, ROC