微生物组研究中中心对数比矩阵的多样本估计
统计方法学
2021-06-17 v1
摘要
在微生物组研究中,基于测序读段计数估计细菌组成是研究细菌丰度的方法之一。随后对此类组成数据施加各种变换以进行下游统计分析,其中中心对数比(clr)变换最为常用。由于测序深度有限和 DNA 丢失,许多稀有细菌类群可能未被最终测序读段捕获,导致大量零计数。使用计数归一化的朴素组成估计会产生许多零比例,使 clr 变换不可行。本文提出一种多样本方法直接估计 clr 矩阵,以跨样本和跨物种借用信息。真实数据集的经验结果表明,多样本上的 clr 矩阵近似低秩,这促使我们采用带核范数惩罚的正则化极大似然估计。我们开发了使用广义加速近端梯度的有效优化算法。建立了估计误差及其对应奇异子空间误差的理论上界。模拟研究表明所提估计量优于朴素估计量。该方法在 Gut Microbiome 数据集和 American Gut 项目上进行了分析。
引用
@article{arxiv.2106.08360,
title = {Multi-sample estimation of centered log-ratio matrix in microbiome studies},
author = {Yezheng Li and Hongzhe Li and Yuanpei Cao},
journal= {arXiv preprint arXiv:2106.08360},
year = {2021}
}