中文

利用声学识别和知识蒸馏在环境音频中进行高效语音检测

声音 2023-12-18 v1 人工智能 机器学习 音频与语音处理

摘要

持续的生物多样性危机,由土地利用变化和全球变暖等因素驱动,强调了有效生态监测方法的必要性。声学生物多样性监测已成为一种重要的监测工具。在声景监测项目中检测人声对于分析人类干扰和隐私过滤都很有用。尽管近年来深度学习取得了显著进展,但由于内存和延迟限制,在紧凑设备上部署大型神经网络仍面临挑战。我们的方法侧重于利用知识蒸馏技术设计用于生物声学中语音检测的高效轻量学生模型。具体来说,我们采用了MobileNetV3-Small-Pi模型来创建紧凑而有效的学生架构,以与较大的EcoVAD教师模型(一种在生态声学监测中备受推崇的语音检测架构)进行比较。比较分析包括检查MobileNetV3-Small-Pi衍生学生模型的各种配置,以确定最佳性能。此外,对不同蒸馏技术进行了彻底评估,以确定模型选择的最有效方法。我们的发现表明,蒸馏模型表现出与EcoVAD教师模型相当的性能,表明这是一种克服实时生态监测计算障碍的有前景的方法。

关键词

引用

@article{arxiv.2312.09269,
  title  = {Efficient speech detection in environmental audio using acoustic recognition and knowledge distillation},
  author = {Drew Priebe and Burooj Ghani and Dan Stowell},
  journal= {arXiv preprint arXiv:2312.09269},
  year   = {2023}
}