大规模音频记录中人声产生的检测与分类
声音
2023-08-14 v2 机器学习
音频与语音处理
应用统计
摘要
我们提出一种自动数据处理流水线,用于从大规模自然音频记录中提取人声产生并对其进行分类。该流水线基于深度神经网络,同时解决上述两个问题。通过一系列计算步骤(加窗、创建噪声类、数据增强、重采样、迁移学习、贝叶斯优化),它可在无需大量标注数据样本与重要计算资源的情况下自动训练神经网络。我们的端到端方法可处理不同录音条件下获取的含噪记录。我们在两个不同自然音频数据集上测试:一个来自灵长类研究中心记录的几内亚狒狒群体,另一个来自家庭环境记录的人类婴儿。该流水线在 72 和 77 分钟标注音频上训练模型,准确率分别为 94.58% 和 99.76%。随后用于处理 443 和 174 小时自然连续录音,分别创建 38.8 和 35.2 小时的两个新数据库。我们讨论了该方法的优势与局限,其可应用于任意海量音频记录。
引用
@article{arxiv.2302.07640,
title = {Detection and classification of vocal productions in large scale audio recordings},
author = {Guillem Bonafos and Pierre Pudlo and Jean-Marc Freyermuth and Thierry Legou and Joël Fagot and Samuel Tronçon and Arnaud Rey},
journal= {arXiv preprint arXiv:2302.07640},
year = {2023}
}