应用最大熵原理于神经网络以提升多物种分布模型
机器学习
2026-01-14 v4 机器学习
摘要
公民科学倡议的快速扩张导致了生物多样性数据库的显著增长,尤其是仅存在(presence-only, PO)观测数据。PO数据对于理解物种分布及其动态至关重要,但其在物种分布模型(SDM)中的使用受到样本偏差和缺乏缺失信息的限制。泊松点过程在SDM中广泛使用,其中Maxent是最流行的方法之一。Maxent通过对预定义变量转换函数(称为特征)的概率分布熵进行最大化来实现。相比之下,神经网络和深度学习已成为从复杂输入变量中自动提取特征的有前景的技术。通过反向传播和随机梯度下降(SGD),可以有效地从数据中学习任意复杂的输入变量转换。在本文中,我们提出DeepMaxent,该方法利用神经网络自动学习物种间共享特征,运用最大熵原理。为此,它采用归一化泊松损失,其中对每个物种,样本点的存在概率由神经网络建模。我们在一个因空间样本偏差而知名的基准数据集上评估了DeepMaxent,使用PO数据进行校准,使用存在-缺失(PA)数据进行验证,覆盖六个地理区域,涵盖不同的生物学群系和协变量。我们的结果表明,DeepMaxent在所有地理区域和生物学群系中均优于Maxent和其他领先的SDM。该方法在样本不均匀的地区表现尤为出色,显示出显著的潜力以提升SDM性能。特别是,我们的方法比传统的单物种模型提供更精确的预测,为方法论的改进开辟了新的可能性。
关键词
引用
@article{arxiv.2412.19217,
title = {Applying the maximum entropy principle to neural networks enhances multi-species distribution models},
author = {Maxime Ryckewaert and Diego Marcos and Christophe Botella and Maximilien Servajean and Pierre Bonnet and Alexis Joly},
journal= {arXiv preprint arXiv:2412.19217},
year = {2026}
}
备注
Submitted to Methods in Ecology and Evolution