优化用于不平衡数据的代价敏感SVM:连接聚类与分类
机器学习
2017-02-07 v1
摘要
类别不平衡是机器学习在许多实际应用(如煤与瓦斯突出事故监测)中面临的挑战性问题之一:突出前兆数据极少于正常数据,然而这正是我们真正关注的重点。代价敏感调整方法是一种典型的算法级抗数据集不平衡方法。对于SVM分类器,其被修改为对每一考虑的样本组引入不同的惩罚参数(C)。然而,C值通过经验确定,或根据评估指标计算,这需要迭代计算且耗时。本文提出一种新颖的代价敏感SVM方法,其惩罚参数C基于聚类概率密度函数(PDF)进行优化,且聚类PDF仅根据相似矩阵和一些预定义超参数来估计。在不同不平衡比例的各种标准基准数据集和真实世界数据上的实验结果表明,与常用代价敏感技术相比,所提方法有效。
引用
@article{arxiv.1702.01504,
title = {Optimizing Cost-Sensitive SVM for Imbalanced Data :Connecting Cluster to Classification},
author = {Qiuyan Yan and Shixiong Xia and Fanrong Meng},
journal= {arXiv preprint arXiv:1702.01504},
year = {2017}
}