中文

面向水下生物声学降噪与识别的多表示注意力框架

音频与语音处理 2025-11-03 v1 机器学习 声音 应用统计 机器学习

摘要

自动监测 St. Lawrence 河口的海洋哺乳动物面临巨大挑战:声调用 span 从低频咆哮到超声点击,常常重叠,并嵌入可变的类人噪声和环境噪声中。我们引入一个多步骤、以注意力为导向的框架,首先对 spectrogram 进行分割以生成生物学相关能量的软掩码,然后将这些掩码与原始输入融合以实现多带、降噪后的分类。通过中期融合集成图像和掩码嵌入,使模型能够聚焦于关键的 spectrogram 区域,同时保持全局上下文。使用来自加拿大 Saguenay St. Lawrence Marine Park 研究站的真实录音,我们展示,分割驱动的注意力和中期融合在信号辨识、减少误报检测方面取得显著效果,并在多样化的环境条件和信噪比下产生可靠的表征以支持实际的海洋生物监测。除了分布内评估外,我们进一步评估了 Mask-Guided Classification (MGC) 在分布迁移下的泛化性,通过测试使用 alternative acoustic 变换生成的 spectrogram。虽然高容量基线模型在此 OOD 设置下丢失准确度,但 MGC 保持稳定性能,甚至简单融合机制(如门控、拼接)在分布之间实现了可比的结果。这一鲁棒性突显了 MGC 学习可转移表征的能力,而非对特定变换过拟合,从而强化了其在大规模真实世界生物多样性监测中的适用性。我们在所有实验设置下都证明,MGC 框架 consistently 超过基线体系结构,在分布内和 OOD 数据上均实现显著的准确度提升。

关键词

引用

@article{arxiv.2510.26838,
  title  = {Multi-Representation Attention Framework for Underwater Bioacoustic Denoising and Recognition},
  author = {Amine Razig and Youssef Soulaymani and Loubna Benabbou and Pierre Cauchy},
  journal= {arXiv preprint arXiv:2510.26838},
  year   = {2025}
}