高维回归的非参数变量选择、聚类与预测
统计方法学
2016-04-15 v3
摘要
在高维回归设置中,由于样本量相对较小以及大量协变量之间存在复杂的交互模式,开发用于可靠推断和响应预测的简约模型往往具有挑战性。我们提出了一个高效、非参数的框架,用于在高通量回归设置中同时进行变量选择、聚类和预测(适用于连续或离散结果),称为 VariScan。VariScan 模型利用 Poisson-Dirichlet 过程 (PDPs) 诱导的稀疏性,将协变量分组为低维潜在聚类,这些聚类由样本中具有相似模式的协变量组成。数据被允许指导合适聚类分配方案的选择,即在 PDPs 及其特例 Dirichlet 过程之间进行选择。随后,利用潜在聚类构建响应的非线性预测模型,该模型采用线性和非线性元素的自适应混合,从而实现模型简约性与灵活性之间的平衡。我们研究了 VariScan 过程的理论性质,这些性质在聚类数量和相对大小方面区分了 PDPs 和 Dirichlet 过程的分配模式。额外的理论结果保证了基于模型的聚类过程的高准确性,并确立了模型选择和预测的一致性。通过模拟研究和对基准数据集的分析,我们证明了 VariScan 聚类机制的可靠性,并表明该技术在受试者特定响应的预测准确性方面与现有方法相比具有优势,且往往优于现有方法。
引用
@article{arxiv.1407.5472,
title = {Nonparametric Variable Selection, Clustering and Prediction for High-Dimensional Regression},
author = {Subharup Guha and Veerabhadran Baladandayuthapani},
journal= {arXiv preprint arXiv:1407.5472},
year = {2016}
}
备注
Note: this version has been substantially revised and please see new version of the article at the following link: [arXiv:1604.03615]