关于深度学习物种分布建模中伪缺失的选择与有效性
定量方法
2024-06-18 v1 机器学习
种群与进化
摘要
物种分布建模是理解环境条件与物种出现之间复杂关系的高度通用工具。然而,可用数据通常缺乏关于确认物种缺失的信息,且仅限于偶然采样的仅存在观测。为克服这一局限,一种常见方法是采用伪缺失,即被指定为负样本的特定地理位置。虽然伪缺失在单物种分布模型中已得到充分确立,但其在多物种神经网络背景下的应用仍待探索。值得注意的是,物种存在与伪缺失之间显著的类别不平衡问题往往未得到解决。此外,不同类型伪缺失(如随机和目标组背景点)的存在增加了选择过程的复杂性。确定伪缺失类型的最佳组合十分困难,且取决于数据的特征,特别是考虑到某些类型的伪缺失可用于缓解地理偏差。在本文中,我们证明通过修改损失函数将伪缺失整合到多物种神经网络的训练中,可以有效应对这些挑战。这一调整涉及为损失函数的不同项分配不同的权重,从而同时解决类别不平衡和伪缺失类型选择的问题。此外,我们提出了一种利用仅存在数据的空间模块交叉验证来设置这些损失权重的策略。我们使用包含来自六个不同区域的独立存在-缺失数据的基准数据集评估了我们的方法,并与竞争方法相比报告了改进的结果。
引用
@article{arxiv.2401.02989,
title = {On the selection and effectiveness of pseudo-absences for species distribution modeling with deep learning},
author = {Robin Zbinden and Nina van Tiel and Benjamin Kellenberger and Lloyd Hughes and Devis Tuia},
journal= {arXiv preprint arXiv:2401.02989},
year = {2024}
}