在基于CNN的声学场景分类中增强声音纹理
声音
2019-01-08 v1 机器学习
音频与语音处理
信号处理
机器学习
摘要
声学场景分类是识别音频信号录制场景的任务。卷积神经网络(CNN)模型被广泛采用,并在声学场景分类中取得了公认的成功。然而,关于音频场景如何在 CNN 中被感知,却鲜有像图像识别研究中那样深入的见解。在本研究中,利用类激活映射(CAM)分析不同声学场景的对数幅度梅尔尺度滤波器组(log-Mel)特征如何在 CNN 分类器中被学习。注意到音频信号 distinct 的高能量时频分量通常并不对应于 CAM 上的强激活,而背景声音纹理则在 CNN 中被良好学习。为使声音纹理更显著,我们提出应用高斯差分(DoG)与 Sobel 算子处理 log-Mel 特征并增强时频图像的边缘信息。在 DCASE 2017 ASC 挑战赛上的实验结果表明,使用边缘增强的 log-Mel 图像作为 CNN 输入特征显著提升了音频场景分类的性能。
引用
@article{arxiv.1901.01502,
title = {Enhancing Sound Texture in CNN-Based Acoustic Scene Classification},
author = {Yuzhong Wu and Tan Lee},
journal= {arXiv preprint arXiv:1901.01502},
year = {2019}
}
备注
Submitted to ICASSP 2019