利用无监督声音分离改进鸟类分类
音频与语音处理
2021-10-08 v1
摘要
本文解决鸟鸣录音中的物种分类问题。大量可用的鸟类野外录音为使用机器学习自动追踪鸟类种群提供了机会。然而,这也带来一个问题:此类野外录音通常含有显著的环境噪声和重叠的鸣叫,干扰分类。可用于物种识别的广泛训练数据集通常也未对背景物种进行标注。这导致分类器忽略低信噪比的鸣叫。然而,无监督声音分离的最新进展,如混合不变训练(MixIT),使得能够从此类噪声录音中学习到高质量的鸟鸣分离。在本文中,我们展示了专门针对鸟鸣数据训练 MixIT 模型时分离质量的提升,在重建混合信号的 SI-SNR 改善上超过通用音频分离模型 5 dB 以上。我们还展示了在三个独立数据集上下游多物种鸟类分类器精度的提升。最佳分类器性能通过对分离通道和原始音频取模型激活的最大值实现。最后,我们记录了分类器的其他改进,包括分类学分类、随机低通滤波器增广以及额外的通道归一化。
引用
@article{arxiv.2110.03209,
title = {Improving Bird Classification with Unsupervised Sound Separation},
author = {Tom Denton and Scott Wisdom and John R. Hershey},
journal= {arXiv preprint arXiv:2110.03209},
year = {2021}
}
备注
5 pages, 3 figures. Examples available at https://bird-mixit.github.io