BioTrove:一个推动生物多样性AI的大型精选图像数据集
计算机视觉与模式识别
2025-01-29 v2
摘要
我们介绍了BioTrove,这是目前最大的公开可访问数据集,旨在推动AI在生物多样性领域的应用。该数据集来自iNaturalist平台,并经过筛选仅包含研究级数据,包含1.619亿张图像,提供了来自三个主要界(动物界、真菌界和植物界)前所未有的规模和多样性,涵盖约36.66万个物种。每张图像都标注了学名、分类层级和俗名,提供了丰富的元数据,以支持跨不同物种和生态系统的准确AI模型开发。我们通过发布一套CLIP模型来展示BioTrove的价值,这些模型使用4000万张带标题图像的子集(称为BioTrove-Train)进行训练。该子集聚焦于数据集中标准图像识别模型代表性不足的七个类别,这些类别因其在生物多样性和农业中的关键作用而被选中:鸟纲、蛛形纲(蜘蛛/蜱虫/螨虫)、昆虫纲、植物界、真菌界、软体动物门(蜗牛)和爬行纲(蛇/蜥蜴)。为支持严格评估,我们引入了几个新的基准,并报告了模型在零样本学习下跨生命阶段、稀有物种、易混淆物种和多个分类级别的准确率。我们预计BioTrove将推动AI模型的发展,这些模型能够支持用于害虫防治、作物监测、生物多样性评估和环境保护的数字工具。这些进步对于确保粮食安全、保护生态系统和减轻气候变化的影响至关重要。BioTrove是公开可用的,易于访问,并可直接使用。
引用
@article{arxiv.2406.17720,
title = {BioTrove: A Large Curated Image Dataset Enabling AI for Biodiversity},
author = {Chih-Hsuan Yang and Benjamin Feuer and Zaki Jubery and Zi K. Deng and Andre Nakkab and Md Zahid Hasan and Shivani Chiranjeevi and Kelly Marshall and Nirmal Baishnab and Asheesh K Singh and Arti Singh and Soumik Sarkar and Nirav Merchant and Chinmay Hegde and Baskar Ganapathysubramanian},
journal= {arXiv preprint arXiv:2406.17720},
year = {2025}
}