中文

音频预训练在生物声学中并非免费午餐:嵌入的基准研究

声音 2025-08-15 v1 人工智能

摘要

生物声学,即对动物声音的研究,提供了一种非侵入性的生态系统监测方法。从音频预训练的深度学习(DL)模型中提取嵌入而无需微调,已成为获取生物声学特征以用于各项任务的流行方法。然而,最近的一项基准研究表明,虽然微调后的音频预训练VGG和Transformer模型在某些任务中达到了最先进的性能,但在其他任务中却表现不佳。本研究在相同任务上对11个DL模型进行基准测试,通过降低其学习嵌入的维度并通过聚类进行评估。我们发现,音频预训练的DL模型:1)未经微调时甚至不如微调后的AlexNet;2)无论是否微调,都无法将背景与标记声音分离,但ResNet可以;3)在微调过程中包含较少背景声音时,优于其他模型。本研究强调了微调音频预训练模型以及检查微调后嵌入的必要性。我们的代码可在以下网址获取:https://github.com/NeuroscienceAI/Audio\_Embeddings

关键词

引用

@article{arxiv.2508.10230,
  title  = {No Free Lunch from Audio Pretraining in Bioacoustics: A Benchmark Study of Embeddings},
  author = {Chenggang Chen and Zhiyu Yang},
  journal= {arXiv preprint arXiv:2508.10230},
  year   = {2025}
}