中文

面向正未标记分类的鲁棒 AUC 最大化框架:同步进行异常检测与特征选择

机器学习 2018-03-20 v1 机器学习

摘要

正未标记 (PU) 分类是医疗保健、文本分类和生物信息学等现实应用中的常见场景,在此场景中,我们仅观察到少量标记为“正”的样本以及大量可能同时包含正样本和负样本的“未标记”样本。为 PU 问题构建鲁棒的分类器极具挑战性,尤其是对于负样本占主导地位且存在误标记样本或损坏特征的复杂数据。为了解决这三个问题,我们提出了一个鲁棒的学习框架,该框架统一了 AUC 最大化(针对偏倚标签的鲁棒指标)、异常检测(用于排除错误标签)和特征选择(用于排除损坏特征)。为所提模型提供了泛化误差界,这为该方法的理论性能提供了有价值的见解,并给出了有用的实践指导,例如,在训练过程中,我们发现只要样本量与正样本数量相当,所包含的未标记样本就足够了。此外,还进行了经验比较以及在手术部位感染 (SSI) 和 EEG 癫痫检测上的两个现实应用,以展示所提模型的有效性。

关键词

引用

@article{arxiv.1803.06604,
  title  = {A Robust AUC Maximization Framework with Simultaneous Outlier Detection and Feature Selection for Positive-Unlabeled Classification},
  author = {Ke Ren and Haichuan Yang and Yu Zhao and Mingshan Xue and Hongyu Miao and Shuai Huang and Ji Liu},
  journal= {arXiv preprint arXiv:1803.06604},
  year   = {2018}
}