漂浮森林:基于共识分类生成的公民科学数据的定量验证
物理与社会
2018-01-26 v1 定量方法
摘要
大规模研究工作可能受限于后勤约束,从而限制可用数据量。例如,全球生态问题需要全球数据集,而传统采样方案对于小型研究团队往往过于低效,无法收集充足数据。公民科学通过众包数据收集提供了一种替代方案。尽管日益流行,该群体一直迟迟不愿采用,主要由于对公民科学家所收集数据质量的担忧。利用公民科学项目漂浮森林(http://floatingforests.org),我们表明由公民科学家作出的共识分类所产生数据与专家生成分类质量相当。漂浮森林是一个基于网络的项目,公民科学家在其中查看海岸线卫星照片并描绘海藻斑块边界。自 2014 年启动以来,超过 7000 名公民科学家已分类超过 750000 张主要在加利福尼亚与塔斯马尼亚的海藻森林图像。图像由 15 名用户分类。我们通过叠加所有公民分类生成共识分类,并通过与专家分类比较评估准确性。对每一阈值(1-15)计算马修斯相关系数(MCC),具有最高 MCC 的阈值被视为最优。我们表明最优用户阈值为 4.2,对 Landsat 5 与 7 的 MCC 为 0.400(0.023 SE),对 Landsat 8 的 MCC 为 0.639(0.246 SE)。这些结果表明,源自共识分类的公民科学数据与专家分类准确度相当。公民科学项目应实施如共识分类之类的方法,并结合与专家生成分类的定量比较,以避免对数据质量的担忧。
引用
@article{arxiv.1801.08522,
title = {Floating Forests: Quantitative Validation of Citizen Science Data Generated From Consensus Classifications},
author = {Isaac S. Rosenthal and Jarrett E. K. Byrnes and Kyle C. Cavanaugh and Tom W. Bell and Briana Harder and Alison J. Haupt and Andrew T. W. Rassweiler and Alejandro Pérez-Matus and Jorge Assis and Ali Swanson and Amy Boyer and Adam McMaster and Laura Trouille},
journal= {arXiv preprint arXiv:1801.08522},
year = {2018}
}
备注
14 pages, 5 figures, 2 tables, 1 supplemental figure