中文

(误) 用回归进行数据调整

统计理论 2016-09-30 v6 统计理论

摘要

在各种经济应用中,人们希望就某些衡量其表现的量 Y1,Y2,,YnY_1, Y_2, \ldots, Y_n 比较 nn 个单位。然而,后者通常受到单位无法控制的某些因素的影响,因此人们希望从数据中提取调整后的表现。具体而言,设 XiXX_i \in \mathcal{X} 总结第 ii 个单位的因素。于是可以考虑模型方程 Yi=fo(Xi)+ϵiY_i = f_o(X_i) + \epsilon_i,其中回归函数 fo:XRf_o : \mathcal{X} \to \mathbb{R} 描述了因素 XiX_i 的不可避免的影响,而 ϵi\epsilon_i 是第 ii 个单位的调整后表现。现在一个常见的提议是通过回归方法,利用当前数据 (Xi,Yi)(X_i,Y_i)(可能辅以额外的历史数据)将 fof_o 估计为函数 f^\hat{f},并使用残差 ϵ^i:=Yif^(Xi)\hat{\epsilon}_i := Y_i - \hat{f}(X_i) 作为调整后表现 ϵi\epsilon_i 的替代物。在本报告中,我们讨论了这种方法、其潜在的陷阱和(误)解释。特别是,残差 ϵ^i\hat{\epsilon}_i 的一个不可避免的性质是,它们仅测量了调整后表现的一部分,而剩余部分则隐藏在估计函数 f^\hat{f} 中。文中简要提及了可能的替代方案。

关键词

引用

@article{arxiv.1202.1964,
  title  = {(Ab)Using Regression for Data Adjustment},
  author = {Lutz Duembgen},
  journal= {arXiv preprint arXiv:1202.1964},
  year   = {2016}
}

备注

Replaces an older manuscript "On Ranks of Regression Errors and Residuals"