中文

鸟类发声的半监督分类

声音 2025-02-20 v1 人工智能 计算机视觉与模式识别 音频与语音处理 定量方法

摘要

鸟类种群的变化可以指示生态系统的更广泛变化,这使得鸟类成为最重要的监测动物群体之一。将机器学习与被动声学相结合,能够在无需人类直接参与的情况下实现长时间的连续监测。然而,现有的多数技术需要大量专家标注的数据集进行训练,且难以在嘈杂的声景中检测时间重叠的鸣叫。我们提出了一种半监督声学鸟类检测器,旨在既能检测时间重叠的鸣叫(在频率上分离时),又能使用少量标注训练样本。该分类器在社区录制的开源数据与来自新加坡的长时间声景录音的组合上进行了训练和评估。在留出测试集上,针对来自 110 个鸟类的 315 个类别,其平均 F0.5 分数达到 0.701,平均每个类别仅有 11 个标注训练样本。尽管使用的标注训练样本显著更少,但在包含 103 个鸟类的测试集上,它优于 state-of-the-art 的 BirdNET 分类器。该检测器还在 144 麦克风小时的连续声景数据上进行了进一步测试。新加坡丰富的声景使得在原始连续数据流中抑制假阳性成为一项挑战。尽管如此,我们证明了在此类环境中使用最少的标注训练数据实现高精度是可能的。

关键词

引用

@article{arxiv.2502.13440,
  title  = {Semi-supervised classification of bird vocalizations},
  author = {Simen Hexeberg and Mandar Chitre and Matthias Hoffmann-Kuhnt and Bing Wen Low},
  journal= {arXiv preprint arXiv:2502.13440},
  year   = {2025}
}