中文

CoarseSoundNet:用于生态声景分析的可靠模型构建

声音 2026-05-22 v2 机器学习

摘要

声景由三类声音组成:生物声(由动物发出的声音)、地貌声(自然非生物声)和人类声(由人类发出的声音)。声景生态学领域的关键研究问题是,这些组成部分如何相互作用,特别是生物声如何响应地貌声和人类声。然而,目前并不缺少能够独立量化这些元素的分析工具。最近的机器学习(ML)方法旨在支持自动化分析,但常常依赖于特定任务或干净数据,限制了其对噪声被动声学监测(PAM)录音的泛化能力。本研究提出一种清晰且可重复的结构,用于构建粗糙声景分类的机器学习模型,并介绍CoarseSoundNet——一种在真实PAM条件下区分生物声、地貌声和人类声的深度学习模型。我们系统性地调查模型架构、额外训练类的影响、数据组成以及评估策略。我们的发现表明,随着额外PAM数据的增加,尤其是当数据与目标领域相似时,模型性能会提高;通过在训练时引入显式的静默类可以提升性能。特定的决策阈值和持续时间限制进一步提高了性能,尤其是针对人类声和地貌声。在错误分析中,人类声因掩蔽效应而面临挑战,静默声和昆虫声在地貌声和生物声方面存在混淆。最后,我们进行了一次生态案例研究,表明使用CoarseSoundNet预过滤录音可产生与真实过滤相似的声学指数趋势,支持其作为生态声学分析的有效预处理工具。

关键词

引用

@article{arxiv.2605.21143,
  title  = {CoarseSoundNet: Building a reliable model for ecological soundscape analysis},
  author = {Alexander Gebhard and Andreas Triantafyllopoulos and Dominik Arend and Sandra Müller and Svenja Schmidt and Michael Scherer-Lorenzen and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2605.21143},
  year   = {2026}
}

备注

Currently under review