中文

鲁棒、通用且低复杂度的声学场景分类系统及用于呈现声音场景上下文的有效可视化方法

声音 2022-10-18 v1 人工智能 音频与语音处理

摘要

本文中,我们对声学场景分类(ASC)——即依据录音的声学特征识别其场景的任务——进行了全面分析。具体地,我们首先提出一种基于 inception 且低占用的 ASC 模型,称为 ASC 基线。随后将该 ASC 基线与 MobileNetV1、MobileNetV2、VGG16、VGG19、ResNet50V2、ResNet152V2、DenseNet121、DenseNet201 及 Xception 等基准与高复杂度网络架构进行比较。接着,我们通过提出一种利用残差-inception 架构与多核的新颖深度神经网络架构来改进 ASC 基线。基于该新颖残差-inception(NRI)模型,我们进一步评估了模型复杂度与模型精度性能之间的权衡。最后,我们评估了声音场景中发生的声音事件是否有助于提升 ASC 精度,进而指出如何结合声音场景与声音事件信息来良好呈现声音场景上下文。我们在多个 ASC 数据集上开展了广泛实验,包括 Crowded Scenes、IEEE AASP 声学场景与事件检测及分类挑战(DCASE)2018 Task 1A 与 1B、2019 Task 1A 与 1B、2020 Task 1A、2021 Task 1A、2022 Task 1。在若干不同 ASC 挑战上的实验结果凸显了两方面的成果:其一是提出了适用于广泛边缘设备与移动端实际应用的鲁棒、通用且低复杂度 ASC 系统;其二是提出了一种用于全面呈现声音场景上下文的有效可视化方法。

关键词

引用

@article{arxiv.2210.08610,
  title  = {Robust, General, and Low Complexity Acoustic Scene Classification Systems and An Effective Visualization for Presenting a Sound Scene Context},
  author = {Lam Pham and Dusan Salovic and Anahid Jalali and Alexander Schindler and Khoa Tran and Canh Vu and Phu X. Nguyen},
  journal= {arXiv preprint arXiv:2210.08610},
  year   = {2022}
}