中文

技术报告:评估指标与采样对生物多样性指标预测机器学习方法比较的影响

应用统计 2021-08-18 v1

摘要

机器学习(ML)方法在生物多样性监测中的应用日益广泛。其中一个重要应用是基于包含气候与人为因素等预测变量集,预测物种丰度、物种出现或物种丰富度等生物多样性指标。考虑到文献中可用的不同 ML 方法数量惊人且发表速度迅猛,建立统一的评估流程以产出严谨而公平的实证研究至关重要。然而,定义公平的评估流程颇具挑战:由于生物多样性指标具有零膨胀和过离散等已有充分记录的固有属性,设计良好的交叉验证采样方案与优良的评估指标并非易事。事实上,经典的均方误差(MSE)未能捕捉不同方法性能间的细微差异,尤其在极小或极大值的预测方面(例如零计数或大量计数)。在本报告中,我们通过在基于地理、气象与时空因素预测北非地区水鸟丰度的任务上比较十种统计与机器学习模型,阐明了这一现象。我们的结果凸显出,不同的即用型评估指标与交叉验证采样方法会导致指标排名截然不同,且无法得出可解释的结论。

关键词

引用

@article{arxiv.2108.07480,
  title  = {Technical report: Impact of evaluation metrics and sampling on the comparison of machine learning methods for biodiversity indicators prediction},
  author = {Geneviève Robin and Cathia Le Hasif},
  journal= {arXiv preprint arXiv:2108.07480},
  year   = {2021}
}