中文

ERANNs:面向音频模式识别的高效残差音频神经网络

声音 2022-07-21 v7 音频与语音处理

摘要

音频模式识别(APR)是一个重要的研究课题,可应用于与我们生活相关的若干领域。因此,需要开发准确且高效的 APR 系统,因为它们在实际应用中很有用。本文中,我们提出了一种新的卷积神经网络(CNN)架构以及一种提升基于 CNN 的 APR 任务系统推理速度的方法。此外,使用所提方法,我们可以提升系统性能,这已在四个音频数据集上的实验得到证实。另外,我们研究了数据增强技术与迁移学习对系统性能的影响。我们的最佳系统在 AudioSet 数据集上取得了 0.450 的平均精度均值(mAP)。尽管该值低于最先进系统,但所提系统快 7.1 倍且小 9.7 倍。在 ESC-50、UrbanSound8K 和 RAVDESS 数据集上,我们分别以 0.961、0.908 和 0.748 的准确率取得了最先进结果。我们用于 ESC-50 数据集的系统比先前最佳系统快 1.7 倍且小 2.3 倍。对于 RAVDESS 数据集,我们的系统比先前最佳系统小 3.3 倍。我们将我们的系统命名为“高效残差音频神经网络”(Efficient Residual Audio Neural Networks)。

关键词

引用

@article{arxiv.2106.01621,
  title  = {ERANNs: Efficient Residual Audio Neural Networks for Audio Pattern Recognition},
  author = {Sergey Verbitskiy and Vladimir Berikov and Viacheslav Vyshegorodtsev},
  journal= {arXiv preprint arXiv:2106.01621},
  year   = {2022}
}

备注

This paper has been submitted to Pattern Recognition Letters