中文

BirdSet:面向鸟类生物声学音频分类的大规模数据集

声音 2025-05-20 v6 人工智能 音频与语音处理

摘要

深度学习(DL)极大地推动了音频分类的发展,但该领域受限于缺乏大规模基准数据集,而正是这些数据集推动了其他领域的进步。虽然 AudioSet 作为通用领域数据集是弥合这一差距的关键一步,但其受限的可访问性和有限的评估用例范围挑战了其作为唯一资源的地位。因此,我们引入了 BirdSet,一个专注于鸟类生物声学的大规模音频分类基准数据集。BirdSet 超越了 AudioSet,拥有来自近 10,000 个类别的超过 6,800 小时的录音( ⁣17%\uparrow\!17\%)用于训练,以及超过 400 小时( ⁣7×\uparrow\!7\times)的强标注评估数据,涵盖八个评估数据集。它作为一个多功能资源,适用于多标签分类、协变量偏移或自监督学习等用例。我们在三种不同的训练场景下对六个著名的 DL 模型在多标签分类任务上进行了基准测试,并概述了音频分类的进一步评估用例。我们将数据集托管在 Hugging Face 上以便于访问,并提供了一个广泛的代码库来复现我们的结果。

关键词

引用

@article{arxiv.2403.10380,
  title  = {BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics},
  author = {Lukas Rauch and Raphael Schwinger and Moritz Wirth and René Heinrich and Denis Huseljic and Marek Herde and Jonas Lange and Stefan Kahl and Bernhard Sick and Sven Tomforde and Christoph Scholz},
  journal= {arXiv preprint arXiv:2403.10380},
  year   = {2025}
}

备注

accepted as spotlight @ICLR2025