从固定X到随机X回归:偏差-方差分解、协方差惩罚与预测误差估计
统计方法学
2017-06-13 v2
摘要
在统计预测中,基于协方差惩罚的模型选择与模型评价的经典方法仍被广泛使用。关于该主题的大部分文献基于我们称之为“固定X(Fixed-X)”的假设,即假定协变量值非随机。相比之下,采用“随机X(Random-X)”观点往往更合理,其中协变量值对于训练和预测均是独立抽取的。为研究协方差惩罚在此环境下的适用性,我们提出了一种随机X预测误差的分解,其中协变量的随机性对偏差和方差分量均有贡献。该分解具有一般性,但我们聚焦于最小二乘回归的基本情形。我们证明,在此情形下,从固定X到随机X预测的转移导致偏差和方差均增大。当协变量服从正态分布且线性模型无偏时,该分解中的所有项均可显式计算,从而得到我们称之为的扩展,即。对于某些类别的非正态协变量也渐近成立。当噪声方差未知时,代入通常的无偏估计得到一种我们称之为的方法,它与Sp(Tukey 1967)和GCV(Craven and Wahba 1978)密切相关。对于超额偏差,我们基于普通交叉验证(OCV)的“快捷公式”提出一种估计,得到一种称为的方法。理论论证与数值模拟表明,通常优于OCV,尽管差异很小。我们进一步考察了其他流行估计量的随机X误差。我们在岭回归上得到的令人惊讶的结果是:在强正则化区域,随机X方差小于固定X方差,这可能导致更小的整体随机X误差。
引用
@article{arxiv.1704.08160,
title = {From Fixed-X to Random-X Regression: Bias-Variance Decompositions, Covariance Penalties, and Prediction Error Estimation},
author = {Saharon Rosset and Ryan J. Tibshirani},
journal= {arXiv preprint arXiv:1704.08160},
year = {2017}
}