将多物种占域模型扩展至大规模公民科学数据集
应用统计
2022-06-20 v1 机器学习
统计计算
摘要
公民科学数据集可以非常庞大,并有望改进物种分布建模,但探测过程并不完美,在拟合模型时存在偏差风险。特别是,观测者可能探测不到实际存在的物种。占域模型可以估计并校正这一观测过程,而多物种占域模型利用观测过程中的相似性,能够改善对稀有物种的估计。然而,目前用于拟合这些模型的计算方法无法扩展至大规模数据集。我们开发了近似贝叶斯推断方法,并使用图形处理单元(GPU)将多物种占域模型扩展至超大规模的公民科学数据。我们将多物种占域模型拟合到来自 eBird 项目的一个月数据,该数据包含 186,811 条记录,涵盖 430 种鸟类。我们在空间上分离的、包含 59,338 条记录的测试集上评估了预测结果,比较了两种不同的推断方法——马尔可夫链蒙特卡罗(MCMC)和变分推断(VI)——与使用最大似然对每个物种单独拟合的占域模型。我们使用 VI 对整个数据集进行了模型拟合,并使用 MCMC 对多达 32,000 条记录进行了拟合。对整个数据集拟合的 VI 表现最佳,在 AUC(90.4% 对比 88.7%)和对数似然(-0.080 对比 -0.085)上均优于单物种模型。我们还评估了模型预测的分布图与专家地图的一致性。我们发现,对探测过程进行建模极大地改善了一致性,并且所得地图与专家地图的一致性,与使用高质量调查数据估计的地图一样接近。我们的结果表明,多物种占域模型是对大规模公民科学数据集进行建模的一种引人注目的方法,并且一旦考虑了观测过程,它们就能准确地模拟物种分布。
引用
@article{arxiv.2206.08894,
title = {Scaling multi-species occupancy models to large citizen science datasets},
author = {Martin Ingram and Damjan Vukcevic and Nick Golding},
journal= {arXiv preprint arXiv:2206.08894},
year = {2022}
}
备注
39 pages, 6 figures (+ supplementary material)