中文

基于方言校准数据增强的跨方言鸟类物种识别

声音 2025-09-29 v1 音频与语音处理

摘要

方言变异阻碍了对被动声学监测收集的鸟鸣声的自动识别。我们在 DB3V(一个包含三个地区、十个物种的 8 秒音频片段语料库)上解决了这一问题,并提出一个建立在时延神经网络(TDNN)之上的可部署框架。频率敏感归一化(实例频率归一化和门控松弛 IFN)与梯度反转对抗训练相结合,以学习区域不变的嵌入。多层级数据增强方案结合了波形扰动、针对稀有类别的 Mixup 以及合成 Region 2(内陆平原)风格音频的 CycleGAN 迁移,其中方言校准增强(DCA)对合成样本进行软降权以限制伪影。与基线 TDNN 相比,完整系统将跨方言准确率提升了多达二十个百分点,同时保持了区域内性能。Grad-CAM 和 LIME 分析表明,鲁棒模型集中于稳定的谐波频带,提供了具有生态学意义的解释。该研究表明,轻量级、透明且具备方言鲁棒性的鸟声识别是可实现的。

关键词

引用

@article{arxiv.2509.22317,
  title  = {Cross-Dialect Bird Species Recognition with Dialect-Calibrated Augmentation},
  author = {Jiani Ding and Qiyang Sun and Alican Akman and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2509.22317},
  year   = {2025}
}