中文

用于环境声音分类的多通道时序注意力卷积神经网络模型

音频与语音处理 2020-11-06 v1 声音

摘要

近来,许多基于注意力的深度神经网络涌现并在环境声音分类中取得了最先进的性能。注意力机制的本质是对特征的不同部分(即通道、频谱或空间内容以及时间帧)分配贡献权重。本文中,我们提出了一种带多通道时序注意力(MCTA)模块的有效卷积神经网络结构,该模块在嵌入特征的每个通道内应用时序注意力机制以提取通道级相关时序信息。这种多通道时序注意力结构将为每个通道产生不同的注意力向量,使网络能充分利用不同通道中的相关时序信息。用于测试我们模型的数据集包括 ESC-50 及其子集 ESC-10,以及 DCASE 2018 和 2019 的开发集。在我们的实验中,MCTA 以相同参数量优于单通道时序注意力模型和无注意力模型。此外,我们将我们的模型与一些成功的基于注意力的模型进行比较,并以相对轻量的网络取得了有竞争力的结果。

关键词

引用

@article{arxiv.2011.02561,
  title  = {A Multi-Channel Temporal Attention Convolutional Neural Network Model for Environmental Sound Classification},
  author = {You Wang and Chuyao Feng and David V. Anderson},
  journal= {arXiv preprint arXiv:2011.02561},
  year   = {2020}
}

备注

5 pages, 4 figures