ESResNet:基于视觉域模型的环境声音分类
计算机视觉与模式识别
2020-04-17 v1 机器学习
声音
音频与语音处理
摘要
环境声音分类(ESC)是音频领域一个活跃的研究方向,近年来取得了诸多进展。然而,许多现有方法依赖特定领域的特征与架构来实现高准确率,这使得难以从其他领域(例如图像域)的进展中获益。此外,过去的一些成功被归因于结果评估方式的不一致(即基于 UrbanSound8K(US8K)数据集的非官方划分),扭曲了该领域的整体进展。本文的贡献有两点。首先,我们提出了一种天然兼容单声道与立体声声音输入的模型。我们的模型基于简单的对数功率短时傅里叶变换(STFT)谱图,并将其与图像域若干知名方法(即 ResNet、孪生网络式网络和注意力机制)相结合。我们研究了跨域预训练、架构改动的影响,并在标准数据集上评估了我们的模型。我们发现,在公平比较下,我们的模型以 97.0%(ESC-10)、91.5%(ESC-50)以及 84.2% / 85.4%(US8K 单声道 / 立体声)的准确率超越了所有先前已知的方法。其次,我们通过将 US8K 数据集上若干先前报告的结果区分为官方或非官方划分,对该领域实际现状给出了全面概览。为了更好的可复现性,我们的代码(包括任何重新实现)均已公开。
引用
@article{arxiv.2004.07301,
title = {ESResNet: Environmental Sound Classification Based on Visual Domain Models},
author = {Andrey Guzhov and Federico Raue and Jörn Hees and Andreas Dengel},
journal= {arXiv preprint arXiv:2004.07301},
year = {2020}
}
备注
8 pages, 4 figures; submitted to ICPR 2020