DivShift: 探索大规模志愿者收集生物多样性数据集中的领域特定分布迁移
摘要
大规模志愿者收集的社区识别自然界图像数据集,如iNaturalist,已为使用机器学习方法对物种进行精细视觉分类带来显著性能提升。然而,这些数据——有时称为志愿者科学数据——是机会性的,缺乏结构化的抽样策略。这种志愿者收集的生物多样性数据包含地理、时空、分类学、观察者和社会政治偏见,这些偏见可能对生物多样性模型性能产生显著影响,但其对精细物种识别性能的影响尚不清楚。本文引入多样性偏移(DivShift),用于量化领域特定分布迁移对机器学习模型性能的影响。为诊断志愿者收集的生物多样性数据中特定偏见的性能影响,我们还引入DivShift - 北美西海岸(DivShift-NAWC),这是一个涵盖北美西海岸近750万张iNaturalist图像的精选数据集,按五种经专家验证的偏见类型进行划分。我们使用多样化的物种和生态系统聚焦的准确性指标比较这些偏见分区中的物种识别性能。我们观察到,这些偏见的影响小于由底层标签分布迁移引起的预期效果,更多的数据确实导致更好的模型性能,但这些改进的幅度是特定于偏见的。这些发现表明,尽管自然界图像中的结构为生物多样性监测任务提供了泛化改进,但志愿者收集的生物多样性数据中存在的偏见也可能影响模型性能;因此,这些模型在下游生物多样性监测任务中应谨慎使用。
引用
@article{arxiv.2410.19816,
title = {DivShift: Exploring Domain-Specific Distribution Shifts in Large-Scale, Volunteer-Collected Biodiversity Datasets},
author = {Elena Sierra and Lauren E. Gillespie and Salim Soltani and Moises Exposito-Alonso and Teja Kattenborn},
journal= {arXiv preprint arXiv:2410.19816},
year = {2025}
}
备注
Published at AAAI-25 AI for Social Impact Track (https://ojs.aaai.org/index.php/AAAI/article/view/35060) Presented at NeurIPS 2024 Workshop on Tackling Climate Change with Machine Learning (https://www.climatechange.ai/papers/neurips2024/43)