发现影响变量:一种划分方法
应用统计
2010-09-30 v1
摘要
基于技术进步,所有科学学科的一个趋势是高维数据的日益可得,其中埋藏着重要信息。当前统计学家面临的一个紧迫挑战是,从大量杂乱且充满噪声的数据(其中大部分是非信息性的)中开发出有效的方法来寻找有用信息。本文提出了一种通用的计算密集型方法,该方法基于Lo和Zheng开创的一种方法,用于检测众多潜在解释变量中哪些对因变量有影响。该方法适用于检测影响变量,其中因果效应取决于多个变量值的汇合。其优势在于,通过处理许多随机选择的小子集,并依据影响度量从中进一步选择更小子集,从而避免了可能涉及数千个变量的困难直接分析。主要目标是发现影响变量,而非测量其效应。一旦检测到这些变量,处理一个规模小得多的影响变量组的问题,便可通过适当的分析加以解决。从某种意义上说,我们专注于在干草堆中寻找几根针。
引用
@article{arxiv.1009.5744,
title = {Discovering influential variables: A method of partitions},
author = {Herman Chernoff and Shaw-Hwa Lo and Tian Zheng},
journal= {arXiv preprint arXiv:1009.5744},
year = {2010}
}
备注
Published in at http://dx.doi.org/10.1214/09-AOAS265 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)