中文

在聚类总体建模中追踪异质性来源

统计方法学 2021-02-05 v2 机器学习 应用统计 统计计算

摘要

研究人员常常不得不处理具有混合回归关系的异质总体,在数据爆炸时代这一问题日益突出。在此类问题中,当存在许多候选预测变量时,人们不仅关注识别与结局相关的预测变量,还希望区分真正的异质性来源,即识别在聚类中具有不同效应从而真正促成聚类形成的预测变量。我们厘清了考虑聚类潜在尺度差异的异质性来源概念,并提出一种正则化有限混合效应回归,以同时实现异质性追踪与特征选择。顾名思义,该问题在效应模型参数化下表述,其中聚类标签缺失,且各预测变量对结局的效应被分解为一个共同效应项与一组聚类特定项。对这些效应的约束稀疏估计可识别出具有共同效应的变量与具有异质效应的变量。我们提出了一种高效算法,并证明我们的方法可实现估计与选择的一致性。模拟研究进一步证明了该方法在各种实际场景下的有效性。给出了三个应用:一项用于关联阿尔茨海默病遗传因素与脑神经影像性状的影像遗传学研究中,一项用于探索青少年自杀风险与其学区特征之间关联的公共卫生研究,以及一项用于理解棒球运动员薪资水平如何与其表现和合同状态相关的体育分析研究。

关键词

引用

@article{arxiv.2003.04787,
  title  = {Pursuing Sources of Heterogeneity in Modeling Clustered Population},
  author = {Yan Li and Chun Yu and Yize Zhao and Robert H. Aseltine and Weixin Yao and Kun Chen},
  journal= {arXiv preprint arXiv:2003.04787},
  year   = {2021}
}