中文

用于录音设备失配声学场景分类的更宽或更深神经网络架构

声音 2022-03-24 v1 机器学习 音频与语音处理

摘要

本文提出一种鲁棒且低复杂度的声学场景分类(ASC)系统,即识别音频录制场景的任务。我们首先构建ASC基线系统,其中提出一种基于inception-残差的网络架构以应对录音设备失配问题。为进一步提升性能且仍满足低复杂度模型要求,我们在ASC基线系统上应用两种技术:多谱图集成与通道缩减。通过在基准DCASE 2020 Task 1A开发数据集上开展广泛实验,我们取得最佳模型,准确率达69.9%,可训练参数低至2.4M,与最先进ASC系统相当,并具备在边缘设备上实际应用的潜力。

关键词

引用

@article{arxiv.2203.12314,
  title  = {Wider or Deeper Neural Network Architecture for Acoustic Scene Classification with Mismatched Recording Devices},
  author = {Lam Pham and Khoa Dinh and Dat Ngo and Hieu Tang and Alexander Schindler},
  journal= {arXiv preprint arXiv:2203.12314},
  year   = {2022}
}

备注

This paper was submitted to INTERSPEECH 2022