中文

使用广义自由度计算黑盒模型的 AIC:与交叉验证的比较

机器学习 2016-03-10 v1

摘要

广义自由度 (GDF) 由 Ye (1998 JASA 93:120-131) 定义,表示模型拟合对数据扰动的敏感性。因此可以为任何统计模型计算 GDF,原则上使得推导机器学习方法中的参数数量成为可能。GDF 最初仅针对正态分布数据定义,我们在此研究该方法对于伯努利数据的潜力。将模拟和真实数据模型的 GDF 值与来自交叉验证的模型复杂度估计进行比较。类似地,我们计算了随机森林 (randomForest)、神经网络和提升回归树的基于 GDF 的 AICc,并展示了其与交叉验证的相似性。对于二元数据的 GDF 估计不稳定,并且对同时扰动的数据点数量敏感性不一致,同时计算极其耗费计算机资源。重复的 10 折交叉验证更鲁棒、基于更少假设且计算更快。我们的发现表明,GDF 方法不易转移到伯努利数据和更广泛的回归方法。

关键词

引用

@article{arxiv.1603.02743,
  title  = {Computing AIC for black-box models using Generalised Degrees of Freedom: a comparison with cross-validation},
  author = {Severin Hauenstein and Carsten F. Dormann and Simon N Wood},
  journal= {arXiv preprint arXiv:1603.02743},
  year   = {2016}
}

备注

accompanying R-code on github