中文

条件独立性检验的困难性与广义协方差度量

统计理论 2022-03-25 v6 统计理论

摘要

常言道,检验条件独立性,即在给定 Z 时检验两个随机向量 X 和 Y 是否独立,若 Z 为连续随机变量(或向量)则是一个困难的统计问题。在本文中,我们证明条件独立性确实是一个特别难以检验的假设。有效的统计检验要求其所犯第一类错误(size)小于预定义的显著性水平,而不同的检验通常对不同的备择假设类具有功效。我们证明,一个有效的条件独立性检验不对任何备择假设具有功效。鉴于一致有效的条件独立性检验不存在,我们认为必须设计检验使其对特定问题的适用性易于判断。为满足此需求,在 X 和 Y 为单变量的情况下,我们提出将 X 对 Z 以及 Y 对 Z 进行非线性回归,然后基于残差间的样本协方差计算检验统计量,我们称之为广义协方差度量(GCM)。我们证明该形式检验的有效性几乎完全依赖于一个弱要求,即回归过程能够以较慢速率估计给定 Z 时 X 的条件均值以及给定 Z 时 Y 的条件均值。我们将该方法推广到 X 和 Y 可能为多变量甚至高维的情形。虽然我们的通用流程可通过结合任意回归技术与具体问题定制,但我们针对核岭回归给出了理论保证。仿真研究表明,基于 GCM 的检验可与最先进的条件独立性检验相竞争。代码以 R 包 GeneralisedCovarianceMeasure 在 CRAN 上提供。

关键词

引用

@article{arxiv.1804.07203,
  title  = {The Hardness of Conditional Independence Testing and the Generalised Covariance Measure},
  author = {Rajen D. Shah and Jonas Peters},
  journal= {arXiv preprint arXiv:1804.07203},
  year   = {2022}
}

备注

A proof of Lemma 31 has been added. The earlier (and published) version referenced a book for this proof, but it was subsequently discovered that the statement in the book was incorrect