中文

校正众包生态数据中的误分类错误:一种贝叶斯视角

应用统计 2020-06-02 v1 其他统计学

摘要

当对某一过程的直接测量代价高昂或不可行时,许多研究领域会使用由“公民科学家”提供的数据。然而,参与者可能因缺乏技能而报告错误的估计或分类。我们展示了如何利用贝叶斯层次模型在考虑参与者能力的同时推断感兴趣的潜变量。该模型在一个生态应用背景下进行描述,该应用涉及对来自澳大利亚大堡礁的地理参考珊瑚礁图像进行众包分类。感兴趣的潜变量是珊瑚覆盖率,它是珊瑚礁健康的常见指标。参与者的能力通过图像上正确分类点集的灵敏度和特异度来表示。该模型还引入了空间分量,从而可对未调查位置的潜变量进行预测。我们表明,该模型优于用于应对公民科学数据不确定性的传统加权回归方法。我们的方法产生了更精确的回归系数,并对感兴趣的潜过程提供了更好的刻画。这一新方法在概率编程语言 Stan 中实现,可应用于大量依赖不确定公民科学数据的问题。

关键词

引用

@article{arxiv.2006.00741,
  title  = {Correcting misclassification errors in crowdsourced ecological data: A Bayesian perspective},
  author = {Edgar Santos-Fernandez and Erin E. Peterson and Julie Vercelloni and Em Rushworth and Kerrie Mengersen},
  journal= {arXiv preprint arXiv:2006.00741},
  year   = {2020}
}

备注

18 figures, 5 tables