中文

在基于CNN的声学场景分类中增强声音纹理

声音 2019-01-08 v1 机器学习 音频与语音处理 信号处理 机器学习

摘要

声学场景分类是识别音频信号录制场景的任务。卷积神经网络(CNN)模型被广泛采用,并在声学场景分类中取得了公认的成功。然而,关于音频场景如何在 CNN 中被感知,却鲜有像图像识别研究中那样深入的见解。在本研究中,利用类激活映射(CAM)分析不同声学场景的对数幅度梅尔尺度滤波器组(log-Mel)特征如何在 CNN 分类器中被学习。注意到音频信号 distinct 的高能量时频分量通常并不对应于 CAM 上的强激活,而背景声音纹理则在 CNN 中被良好学习。为使声音纹理更显著,我们提出应用高斯差分(DoG)与 Sobel 算子处理 log-Mel 特征并增强时频图像的边缘信息。在 DCASE 2017 ASC 挑战赛上的实验结果表明,使用边缘增强的 log-Mel 图像作为 CNN 输入特征显著提升了音频场景分类的性能。

关键词

引用

@article{arxiv.1901.01502,
  title  = {Enhancing Sound Texture in CNN-Based Acoustic Scene Classification},
  author = {Yuzhong Wu and Tan Lee},
  journal= {arXiv preprint arXiv:1901.01502},
  year   = {2019}
}

备注

Submitted to ICASSP 2019