中文

生物声学基础模型

声音 2026-03-31 v2 机器学习 音频与语音处理 定量方法

摘要

自动生物声学分析对于生物多样性监测和保育至关重要,需要能够适应多种生物声学任务的先进深度学习模型。本文综述了大规模预训练生物声学基础模型,并系统检验了它们在多个生物声学分类任务上的可迁移性。我们通过分析预训练数据来源和基准,概述了生物声学表征学习。基于此,我们综述了生物声学基础模型,剖析了模型的训练数据、预处理、数据增强、架构和训练范式。此外,我们在BEANS和BirdSet基准上选取若干模型进行广泛实证研究,评估了在线性探测和注意力探测下的泛化能力。我们的实验分析表明,Perch~2.0在BirdSet(受限评估)中取得最高得分,并在BEANS上实现最强的线性探测结果,这基于多样化的多物种监督预训练;BirdMAE在BirdSet上基于探测策略的最佳模型,BEANS排名第二,后者为NatureLM-audio的编码器BEATsNLM_{NLM};注意力探测有助于从变压器模型中提取全部性能;在注意力探测下,通用音频模型使用自监督学习在AudioSet上训练,优于许多专门的鸟类声模型在BEANS上的表现。这些发现为从业人员选择合适的模型以通过探测适应新的生物声学分类任务提供了有价值的指导。

关键词

引用

@article{arxiv.2508.01277,
  title  = {Foundation Models for Bioacoustics -- a Comparative Review},
  author = {Raphael Schwinger and Paria Vali Zadeh and Lukas Rauch and Mats Kurz and Tom Hauschild and Sam Lapp and Sven Tomforde},
  journal= {arXiv preprint arXiv:2508.01277},
  year   = {2026}
}

备注

Preprint