模型中包含什么?变量选择准则与模型搜索方法的比较
统计方法学
2025-10-06 v1 机器学习
摘要
对于许多科学问题,理解底层机制是研究目标。为了帮助研究者更好地理解底层机制,变量选择是一个关键步骤,它允许识别最相关的回归变量。变量选择方法由基于信息准则的模型评估和模型空间搜索两部分组成。本文全面比较了变量选择方法,使用正确识别率(CIR)、召回率和假发现率(FDR)作为性能指标。我们考虑使用 BIC 和 AIC 进行模型评估,并采用穷举搜索、贪心搜索、LASSO 路径和随机搜索方法进行模型空间搜索;同时也考虑了使用交叉验证的 LASSO。我们对线性和广义线性模型进行了模拟研究,参数化地探索了广泛的现实样本量、效应量和回归变量之间的相关性。我们考虑了包含少量和大量潜在回归变量的模型空间。结果表明,在小模型空间上,穷举搜索 BIC 表现最优;在大模型空间上,随机搜索 BIC 表现最优。这些方法分别获得了最高的 CIR 和最低的 FDR,共同可能支持提高研究可复现性的长期努力。
引用
@article{arxiv.2510.02628,
title = {What is in the model? A Comparison of variable selection criteria and model search approaches},
author = {Shuangshuang Xu and Marco A. R. Ferreira and Allison N. Tegge},
journal= {arXiv preprint arXiv:2510.02628},
year = {2025}
}