面向稀缺数据鲁棒学习的集成风险建模方法
机器学习
2012-01-31 v2 机器学习
摘要
在医疗风险建模中,典型数据是“稀缺”的:它们具有相对较少的训练实例数(N)、删失以及高维性(M)。我们表明,该问题可以通过将其简化为二部排序来有效解决,并引入了新的二部排序算法 Smooth Rank,用于在稀缺数据上进行鲁棒学习。该算法基于预测器的无监督聚合的集成学习。通过与两种“金标准”风险建模方法在 10 个真实生存分析数据集上的比较,证实了我们方法的优势,其中新方法在除具有最大 N/M 比率的两个数据集之外的所有数据集上均取得了最佳结果。为了系统研究数据稀缺性对这三种方法建模的影响,我们进行了两类计算实验:在具有不同大小随机抽取训练集的真实数据上,以及在具有递增特征数量的人工数据上。两项实验均表明,Smooth Rank 在稀缺数据上相较于流行方法具有关键优势;在其他方法出现过拟合的情况下,它不会过拟合。
引用
@article{arxiv.1108.2820,
title = {Ensemble Risk Modeling Method for Robust Learning on Scarce Data},
author = {Marina Sapir},
journal= {arXiv preprint arXiv:1108.2820},
year = {2012}
}