中文

基于并行时-谱注意力的环境声音分类

声音 2020-05-22 v3 机器学习 音频与语音处理

摘要

卷积神经网络(CNN)是环境声音分类(ESC)中性能最佳的神经网络架构之一。近来,时间注意力机制已被用于 CNN 中,以从相关时间帧捕获有用信息用于音频分类,特别是对于未标注声音事件起止时间的弱标注数据。然而,在这些方法中,在获取深度特征时并未显式利用固有的频谱特性与变化。本文中,我们提出一种用于 CNN 的新型并行时-谱注意力机制,以学习判别性声音表示,其通过捕获不同时间帧和频带的重要性来增强时域与频谱特征。构建并行分支以分别应用时域注意力和频谱注意力,从而减轻无声音事件片段的干扰。在三个环境声音分类(ESC)数据集和两个声学场景分类(ASC)数据集上的实验表明,我们的方法提升了分类性能,并对噪声表现出鲁棒性。

关键词

引用

@article{arxiv.1912.06808,
  title  = {Environmental Sound Classification with Parallel Temporal-spectral Attention},
  author = {Helin Wang and Yuexian Zou and Dading Chong and Wenwu Wang},
  journal= {arXiv preprint arXiv:1912.06808},
  year   = {2020}
}

备注

submitted to INTERSPEECH2020