中文

面向微生物群落分析的高维组成型数据鲁棒协方差估计

统计方法学 2020-04-30 v2

摘要

随着当今高通量测序技术的快速发展,微生物群落分析正受到越来越多的关注。观测数据具有以下典型特征:它是高维的、组成型的(位于单形内),并且由于存在过度丰富的分类单元,甚至可能呈尖峰厚尾和高度偏斜,这使得传统的关联分析难以研究微生物分类单元之间的共现与共排斥关系。在本文中,我们应对此类数据的协方差估计挑战。假设基协方差矩阵属于一类公认的稀疏协方差矩阵,我们采用文献中称为中心对数比协方差矩阵的代理矩阵,该矩阵在维数趋于无穷时与真实基协方差矩阵近似不可区分。我们为其中心对数比协方差矩阵构造了一个均值中位数(Median-of-Means, MOM)估计量,并提出了一种对各个元素变异性自适应的阈值化过程。通过施加比文献中亚高斯条件弱得多的有限四阶矩条件,我们在谱范数下推导出了最优收敛速率。此外,我们还提供了关于支撑集恢复的理论保证。MOM 估计量的自适应阈值化过程易于实现,并在存在离群值或重尾时获得鲁棒性。我们进行了详尽的模拟研究,以展示所提过程相对于若干最优(state-of-the-art)方法的优势。最后,我们将所提方法应用于分析人体肠道微生物组数据集。实现该方法的 R 脚本可在 https://github.com/heyongstat/RCEC 获取。

关键词

引用

@article{arxiv.2004.09018,
  title  = {Robust Covariance Estimation for High-dimensional Compositional Data with Application to Microbial Communities Analysis},
  author = {Yong He and Pengfei Liu and Xinsheng Zhang and Wang Zhou},
  journal= {arXiv preprint arXiv:2004.09018},
  year   = {2020}
}