中文

从固定X到随机X回归:偏差-方差分解、协方差惩罚与预测误差估计

统计方法学 2017-06-13 v2

摘要

在统计预测中,基于协方差惩罚的模型选择与模型评价的经典方法仍被广泛使用。关于该主题的大部分文献基于我们称之为“固定X(Fixed-X)”的假设,即假定协变量值非随机。相比之下,采用“随机X(Random-X)”观点往往更合理,其中协变量值对于训练和预测均是独立抽取的。为研究协方差惩罚在此环境下的适用性,我们提出了一种随机X预测误差的分解,其中协变量的随机性对偏差和方差分量均有贡献。该分解具有一般性,但我们聚焦于最小二乘回归的基本情形。我们证明,在此情形下,从固定X到随机X预测的转移导致偏差和方差均增大。当协变量服从正态分布且线性模型无偏时,该分解中的所有项均可显式计算,从而得到我们称之为MallowsCpMallows' Cp的扩展,即RCpRCpRCpRCp对于某些类别的非正态协变量也渐近成立。当噪声方差未知时,代入通常的无偏估计得到一种我们称之为RCp^\hat{RCp}的方法,它与Sp(Tukey 1967)和GCV(Craven and Wahba 1978)密切相关。对于超额偏差,我们基于普通交叉验证(OCV)的“快捷公式”提出一种估计,得到一种称为RCp+RCp^+的方法。理论论证与数值模拟表明,RCP+RCP^+通常优于OCV,尽管差异很小。我们进一步考察了其他流行估计量的随机X误差。我们在岭回归上得到的令人惊讶的结果是:在强正则化区域,随机X方差小于固定X方差,这可能导致更小的整体随机X误差。

关键词

引用

@article{arxiv.1704.08160,
  title  = {From Fixed-X to Random-X Regression: Bias-Variance Decompositions, Covariance Penalties, and Prediction Error Estimation},
  author = {Saharon Rosset and Ryan J. Tibshirani},
  journal= {arXiv preprint arXiv:1704.08160},
  year   = {2017}
}