中文

一种从大型群落数据更快更准确推断物种关联的新方法

定量方法 2023-03-28 v5 种群与进化 应用统计 统计计算

摘要

1. 联合物种分布模型(JSDM)通过环境、生物关联以及可能的空间结构残差协方差的贡献来解释群落组成的空间变异。它们作为群落生态学与宏观生态学的通用分析框架展现出巨大前景,但当前的 JSDM 即使通过潜变量近似,在大型数据集上扩展性很差,限制了它们对当前涌现的大型(例如,宏条形码与宏基因组学)群落数据集的实用性。2. 在此,我们提出一种新颖且更具可扩展性的 JSDM(sjSDM),它通过对联合 JSDM 似然的蒙特卡洛积分避免了使用潜变量的需要,并允许对所有模型组分进行灵活的弹性网络正则化。我们在 PyTorch(一种可利用 CPU 与 GPU 计算的现代机器学习框架)中实现了 sjSDM。利用具有已知物种-物种关联及不同物种数与位点数的模拟群落,我们将 sjSDM 与最先进的 JSDM 实现进行比较,以确定计算运行时间与推断出的物种-物种及物种-环境关联的准确性。3. 我们发现 sjSDM 比现有 JSDM 算法快数个数量级(即使在 CPU 上运行),并且可扩展到非常大的数据集。尽管速度大幅提升,sjSDM 比替代的 JSDM 实现产生更准确的物种关联结构估计。我们使用包含数千个真菌操作分类单元(OTU)的 eDNA 案例研究展示了 sjSDM 对大型群落数据的适用性。4. 我们的 sjSDM 方法使得对具有数百或数千物种的大型群落数据集的 JSDM 分析成为可能,大幅扩展了 JSDM 在生态学中的适用性。我们在一个 R 包中提供了我们的方法,以促进其在实际数据分析中的适用性。

关键词

引用

@article{arxiv.2003.05331,
  title  = {A new method for faster and more accurate inference of species associations from big community data},
  author = {Maximilian Pichler and Florian Hartig},
  journal= {arXiv preprint arXiv:2003.05331},
  year   = {2023}
}

备注

65 pages, 5 figures