中文

高维 Logistic 回归中的似然比检验渐近为重新标定的卡方分布

统计理论 2017-06-06 v1 信息论 math.IT 概率论 机器学习 统计理论

摘要

Logistic 回归每天被成千上万次地用于拟合数据、预测未来结果以及评估解释变量的统计显著性。当用于统计推断时,Logistic 模型通过对似然比检验分布的近似,为回归系数生成 p 值。事实上,Wilks 定理断言,当变量数 pp 固定时,在大样本量 nn 的极限下,两倍对数似然比(LLR)2Λ2\Lambda 服从 χk2\chi^2_k 变量分布;此处 kk 为被检验的变量数。在本文中,我们证明当 pp 相对于 nn 不可忽略时,Wilks 定理不再成立,且卡方近似严重失真;事实上,该近似产生的 p 值过小(在原假设下)。假设 nnppp/nκp/n\rightarrow\kappa(对某常数 κ<1/2\kappa < 1/2)的方式趋于无穷。我们证明,对于一类 Logistic 模型,LLR 收敛于一个重新标定的卡方分布,即 2Λ d α(κ)χk22\Lambda~\stackrel{\mathrm{d}}{\rightarrow}~\alpha(\kappa)\chi_k^2,其中只要维度比 κ\kappa 为正,标定因子 α(κ)\alpha(\kappa) 就大于 1。因此,LLR 大于经典假设的值。例如,当 κ=0.3\kappa=0.3 时,α(κ)1.5\alpha(\kappa)\approx1.5。一般地,我们展示了如何通过求解一个包含两个未知数的非线性方程组来计算标定因子。我们的数学论证较为复杂,使用了近似消息传递理论、非渐近随机矩阵理论和凸几何中的技术。我们还通过证明新的极限分布在有限样本量下是精确的,以补充我们的数学研究。最后,本文的所有结果均可推广至其他一些回归模型,如 probit 回归模型。

关键词

引用

@article{arxiv.1706.01191,
  title  = {The Likelihood Ratio Test in High-Dimensional Logistic Regression Is Asymptotically a Rescaled Chi-Square},
  author = {Pragya Sur and Yuxin Chen and Emmanuel J. Candès},
  journal= {arXiv preprint arXiv:1706.01191},
  year   = {2017}
}

备注

58 pages, 7 figures