使用聚类网络信息准则(NICc)的快速留一簇交叉验证
统计方法学
2025-06-23 v2 机器学习
统计计算
机器学习
摘要
对于在聚类数据上开发但未在模型参数化中考虑簇异质性的预测模型,使用基于簇的验证来评估模型在未见簇上的泛化能力至关重要。本文介绍了一种聚类化的网络信息准则(NICc)估计量,用于近似具有二次可微对数似然函数的标准预测模型的留一簇偏差。NICc可作为基于簇的交叉验证的快速替代方案。Stone(1977)证明,对于具有独立同分布观测的真实参数模型,Akaike信息准则(AIC)与留一观测交叉验证渐近等价。Ripley(1996)指出,源自Stone证明的网络信息准则(NIC)在模型被错误指定时是更好的近似。对于聚类数据,我们通过将NIC中的Fisher信息矩阵替换为聚类调整估计量来推导NICc。当数据表现出更强的聚类性时,NICc施加更大的惩罚,从而使NICc能够更好地防止过度参数化。在模拟研究和实证示例中,我们使用标准回归为具有高斯或二项响应的聚类数据开发预测模型。与标准回归常用的AIC和BIC相比,NICc提供了对留一簇偏差更精确的近似,并在模型大小和变量选择方面产生更准确的结果(由基于簇的交叉验证确定),尤其是在数据表现出强聚类性时。
引用
@article{arxiv.2405.20400,
title = {Fast leave-one-cluster-out cross-validation using clustered Network Information Criterion (NICc)},
author = {Jiaxing Qiu and Douglas E. Lake and Pavel Chernyavskiy and Teague R. Henry},
journal= {arXiv preprint arXiv:2405.20400},
year = {2025}
}
备注
Statistical Methods in Medical Research. 2025