中文

BIOSCAN-5M:面向昆虫生物多样性的多模态数据集

机器学习 2025-03-07 v6 人工智能 计算机视觉与模式识别 种群与进化

摘要

作为全球理解和监测昆虫生物多样性努力的一部分,本文向机器学习社区介绍了BIOSCAN-5M昆虫数据集,并建立了几个基准任务。BIOSCAN-5M是一个包含超过500万标本的综合性数据集,显著扩展了现有的基于图像的生物学数据集,包括分类学标签、原始核苷酸条码序列、分配的条码索引编号、地理信息和尺寸信息。我们提出了三个基准实验,以展示多模态数据类型对分类和聚类准确性的影响。首先,我们在BIOSCAN-5M数据集的DNA条码序列上预训练掩码语言模型,展示了使用该大型参考库对物种级和属级分类性能的影响。其次,我们提出了一种零样子迁移学习任务,用于图像和DNA条码,以对从自监督学习中获得的特征嵌入进行聚类,探讨这些表示嵌入是否能派生出有意义的聚类。最后,我们通过对DNA条码、图像数据和分类学信息进行对比学习,对多模态性进行基准测试。这产生了一个通用的共享嵌入空间,使使用多种信息类型和模态进行分类学分类成为可能。BIOSCAN-5M昆虫数据集的代码仓库已公开于https://github.com/bioscan-ml/BIOSCAN-5M。

关键词

引用

@article{arxiv.2406.12723,
  title  = {BIOSCAN-5M: A Multimodal Dataset for Insect Biodiversity},
  author = {Zahra Gharaee and Scott C. Lowe and ZeMing Gong and Pablo Millan Arias and Nicholas Pellegrino and Austin T. Wang and Joakim Bruslund Haurum and Iuliia Zarubiieva and Lila Kari and Dirk Steinke and Graham W. Taylor and Paul Fieguth and Angel X. Chang},
  journal= {arXiv preprint arXiv:2406.12723},
  year   = {2025}
}