不平衡分类中用于缺失数据生成的经验相似性
机器学习
2019-03-07 v2 机器学习
摘要
当二类分类问题中的训练数据被某一类淹没时,大多数分类技术无法正确识别属于代表性不足类的数据点。我们提出基于相似性的不平衡分类(SBIC),其基于经验相似性函数学习训练数据中的模式。为考虑训练数据的不平衡结构,SBIC利用缺失数据的概念,即来自少数类、可帮助更好地找到两类间边界的数据。SBIC同时优化经验相似性函数的权重并寻找缺失数据点的位置。因此,SBIC使用一种用于合成数据生成的嵌入式机制,其不修改训练数据集,而是改变算法以适应不平衡数据集。从而,SBIC使用了不平衡分类中两大思想流派的观点:如同代价敏感方法,SBIC在算法层面操作以处理不平衡结构;且类似于合成数据生成方法,其利用了来自少数类的未观测数据点的性质。SBIC在不平衡数据集上的应用表明,其与其他常用的不平衡数据集分类技术相当,并在某些情况下优于后者。
引用
@article{arxiv.1508.01235,
title = {Empirical Similarity for Absent Data Generation in Imbalanced Classification},
author = {Arash Pourhabib},
journal= {arXiv preprint arXiv:1508.01235},
year = {2019}
}