中文

面向不平衡数据的基于实例的熵模糊支持向量机

机器学习 2018-07-12 v1 信息论 math.IT 机器学习

摘要

不平衡分类一直是机器学习的一大挑战,因为许多标准分类器主要关注平衡数据集,且往往对多数类产生偏倚结果。我们改进熵模糊支持向量机(EFSVM),并提出基于实例的熵模糊支持向量机(IEFSVM)。EFSVM与IEFSVM均利用k近邻的熵信息确定每个样本的模糊隶属度值,以区分各样本的重要性。IEFSVM在增大近邻数k时考虑每个样本熵模式的多样性,而EFSVM对所有样本使用固定近邻数的单一熵信息。通过改变k,我们能在模糊隶属度值确定中反映样本近邻从近到远的成分变化。在35个公共与12个真实世界不平衡数据集上的数值实验验证了IEFSVM,并使用受试者工作特征曲线下面积(AUC)将其性能与其他SVM及机器学习方法比较。IEFSVM在高不平衡比数据集上展现出高得多的AUC值,表明IEFSVM在处理类不平衡问题上有效。

关键词

引用

@article{arxiv.1807.03933,
  title  = {Instance-based entropy fuzzy support vector machine for imbalanced data},
  author = {Poongjin Cho and Minhyuk Lee and Woojin Chang},
  journal= {arXiv preprint arXiv:1807.03933},
  year   = {2018}
}