基于生成式 AI 的数据增强用于噪声环境中的生物声学分类
声音
2025-12-16 v3 音频与语音处理
应用统计
摘要
获取用于物种分类的鲁棒人工智能(AI)模型训练数据的确具有挑战性,尤其是对于稀有物种而言。数据增强可以通过增加训练数据的多样性来提高分类准确率,且比获取专家标注数据更便宜。然而,许多经典基于图像的数据增强技术不适用于音频频谱图。我们研究了两种生成式 AI 模型作为数据增强工具,用于合成频谱图并补充音频数据:辅助分类生成对抗网络(ACGAN)和去噪扩散概率模型(DDPM)。后者在生成频谱图的真实性以及最终分类任务中的准确性方面表现尤佳。除了这些新方法,我们还提出了一个包含 640 小时鸟鸣 recordings 的新音频数据集,约有 800 个样本由专家标注。风场数据在分类模型中尤其具有挑战性,因为背景风和涡轮噪声。我们在真实数据和合成数据组合上训练一个分类模型集成,效果相当于高度自信的 BirdNET 预测。我们使用的所有分类器都通过包含合成数据而得到改进,分类指标通常随合成数据的增加而提高。我们的方法可用于更广泛的物种和其他土地利用类型的声学信号增强,具有潜在的促进我们发展可靠 AI 稀有物种检测能力。我们的代码可在 https://github.com/gibbona1/SpectrogramGenAI 查阅。
引用
@article{arxiv.2412.01530,
title = {Generative AI-based data augmentation for improved bioacoustic classification in noisy environments},
author = {Anthony Gibbons and Emma King and Ian Donohue and Andrew Parnell},
journal= {arXiv preprint arXiv:2412.01530},
year = {2025}
}
备注
25 pages, 4 tables, 7 figures