ESResNe(X)t-fbsp:学习鲁棒的音频时频变换
声音
2021-04-26 v1 音频与语音处理
摘要
环境声音分类(ESC)是一个快速发展的领域,最近证明了将视觉领域技术应用于音频相关任务的优越性。先前的研究表明,对跨领域方法进行领域特定的修改有望推动整个 ESC 领域向前发展。在本文中,我们提出了一种基于复频率 B 样条(fbsp)小波的新型时频变换层。与高性能音频分类模型一起使用时,所提出的 fbsp 层在标准数据集上相比先前使用的短时傅里叶变换(STFT)提供了准确率提升。我们还研究了不同预训练策略的影响,包括联合使用两个大规模数据集进行权重初始化:ImageNet 和 AudioSet。我们提出的模型在 ESC-50 上达到 95.20% 的准确率,在 UrbanSound8K 数据集上达到 89.14% 的准确率,优于其他方法。此外,我们评估了所提出层带来的模型对抗加性白高斯噪声的鲁棒性提升以及有效采样率的降低,并证明与基于 STFT 的训练相比,fbsp 层提高了模型承受信号扰动的能力。为了可复现性,我们公开了代码。
引用
@article{arxiv.2104.11587,
title = {ESResNe(X)t-fbsp: Learning Robust Time-Frequency Transformation of Audio},
author = {Andrey Guzhov and Federico Raue and Jörn Hees and Andreas Dengel},
journal= {arXiv preprint arXiv:2104.11587},
year = {2021}
}
备注
submitted IJCNN 2021