中文

调或不调:小样本或稀疏数据中岭逻辑回归的案例分析

统计方法学 2021-01-28 v1

摘要

对于具有二分类结果的有限样本,惩罚逻辑回归(如岭逻辑回归(RR))有望比极大似然估计获得更小的系数与预测的均方误差(MSE)。然而,有证据表明 RR 对小而稀疏的数据情形敏感,在单个数据集中表现不佳。本文通过一项全面的模拟研究进一步阐述该问题,考察 RR 相对于在低维设置中表现良好的 Firth 修正的性能。RR 的性能强烈依赖于复杂度参数的选择,该参数通常通过最小化某种样本外预测误差或信息准则来调优。或者,也可根据对真实效应的先验假设来确定。如我们的模拟所示并以一个数据实例说明,在小或稀疏数据集中优化得到的值与最优值呈负相关,且存在显著变异性,这转化为系数的大 MSE 和校准斜率的大变异性。相反,若收缩程度被预先指定,即使在不理想环境(如罕见结果或稀疏预测变量情形)中,也能获得准确的系数与预测。

关键词

引用

@article{arxiv.2101.11230,
  title  = {To tune or not to tune, a case study of ridge logistic regression in small or sparse datasets},
  author = {Hana Šinkovec and Georg Heinze and Rok Blagus and Angelika Geroldinger},
  journal= {arXiv preprint arXiv:2101.11230},
  year   = {2021}
}