用于模型选择的交叉验证:以生态学为例的入门综述
统计方法学
2022-03-10 v1
摘要
生态学中对模型选择原理用于统计推断的日益广泛应用,以信息准则(IC)和交叉验证(CV)技术为基础。尽管诸如赤池信息准则之类的 IC 技术在生态学史上更为流行,CV 是一种通用且日益使用的替代方法。CV 利用数据分割基于(样本外)预测性能估计模型得分,即便在无法推导似然(例如机器学习)或无法精确计数参数(例如混合效应模型和惩罚回归)时也可使用。在此我们提供一份理解并在生态学中应用 CV 的入门综述。我们回顾了常用的 CV 变体,包括近似方法,并根据统计背景对其使用提出建议。我们解释了 CV 一些重要但常被忽视的技术方面,如偏差校正、估计不确定性、得分选择与简约选择规则。我们也澄清了关于 CV 使用障碍(包括计算成本与实现简便性)的误解(与事实),并阐明了 CV 与信息论模型选择方法之间的关系。本文包含两个生态学案例研究以说明这些技术的应用。我们得出结论:基于 CV 的模型选择应广泛应用于生态学分析,因其具有稳健的估计性质及广泛的适用情形。特别地,我们推荐使用留一法(LOO)或近似 LOO CV 以最小化偏差,否则若 K<10 则使用带偏差校正的 K 折 CV。为缓解过拟合,我们推荐通过修正单标准误规则进行校准选择,该规则考虑了过拟合的主要成因:得分估计不确定性。
引用
@article{arxiv.2203.04552,
title = {Cross validation for model selection: a primer with examples from ecology},
author = {Luke Yates and Zach Aandahl and Shane A. Richards and Barry W. Brook},
journal= {arXiv preprint arXiv:2203.04552},
year = {2022}
}
备注
36 pages, 8 figures, 3 tables, 3 boxes