集成泛化误差与偏差-方差成分的高效估计
机器学习
2017-11-16 v1 机器学习
摘要
对于许多应用,基分类器集成是有效的解决方案。其参数(类别数、每个分类器的训练数据量等)的调优需要G,即给定集成的泛化误差。本文关注G的高效估计。核心思想是在输入特征空间的每个点x处,用正态/贝塔分布近似由训练子集引入的随机性下基分类器类得分/概率的方差。我们使用一小部分随机选取的基分类器估计分布参数,并利用这些参数给出G的高效估计方案。我们给出了各类估计器质量的经验证据。我们还展示了它们在设计选择中的效用,例如集成中分类器数量以及用于训练的数据子集大小,这些是实现特定泛化误差值所需的。我们的方法在设计分布式集成分类器方面也具有很大潜力。
引用
@article{arxiv.1711.05482,
title = {Efficient Estimation of Generalization Error and Bias-Variance Components of Ensembles},
author = {Dhruv Mahajan and Vivek Gupta and S Sathiya Keerthi and Sellamanickam Sundararajan and Shravan Narayanamurthy and Rahul Kidambi},
journal= {arXiv preprint arXiv:1711.05482},
year = {2017}
}
备注
12 Pages, 4 Figures, 12 Pages, Under Review in SDM 2018