中文

E-PANNs:基于高效预训练音频神经网络的声音识别

声音 2023-05-31 v1 人工智能 音频与语音处理 信号处理

摘要

声音承载了关于日常环境中活动与事件的丰富信息,例如交通噪声、道路施工、音乐或人声交谈。近期的机器学习方法,如卷积神经网络(CNNs),已被证明能够自动识别声音活动,这一任务被称为音频标注。其中一种方法,预训练音频神经网络(PANNs),提供了一个已在公开可用的 AudioSet 数据集上针对超过 500 种声音类别进行预训练的神经网络,可作为其他任务的基线或起点。然而,现有的 PANNs 模型计算复杂度高且存储需求大。这可能限制 PANNs 在资源受限设备(如边缘声音传感器)上的部署潜力,并且若部署大量此类设备可能导致高能耗。在本文中,我们采用剪枝方法消除 PANNs 模型中的冗余参数,从而降低其计算复杂度与内存需求。所得到的高效 PANNs(E-PANNs)模型减少了 36% 的计算量和 70% 的内存,同时还略微提升了声音识别(音频标注)性能。E-PANNs 模型的代码已以开源许可发布。

关键词

引用

@article{arxiv.2305.18665,
  title  = {E-PANNs: Sound Recognition Using Efficient Pre-trained Audio Neural Networks},
  author = {Arshdeep Singh and Haohe Liu and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:2305.18665},
  year   = {2023}
}

备注

Accepted in Internoise 2023 conference