中文

用于声学事件分类的跨尺度注意力模型

声音 2020-06-17 v2 机器学习 音频与语音处理

摘要

深度卷积神经网络(CNN)的一个主要优势是,通过堆叠多个卷积层可增大所关注的感受野大小。因此,模型可以从顶层探索特征的长程依赖。然而,该网络一个潜在的局限在于,来自底层(可建模短程依赖)的判别性特征在最终表示中被平滑掉。这一局限在声学事件分类(AEC)任务中尤为明显,因为一段音频片段中涉及短时长与长时长事件且均需被分类。本文提出一种跨尺度注意力(CSA)模型,显式地整合来自不同尺度的特征以形成最终表示。此外,我们提出采用注意力机制,根据声学事件的空间与时间特性来指定局部与全局特征的权重。借助数学公式,我们进一步揭示当以残差 CNN(ResCNN)为骨干模型时,所提 CSA 模型可视为一种加权残差 CNN 模型。我们在两个 AEC 数据集上测试了所提模型:一个是城市场景 AEC 任务,另一个是智能汽车环境中的 AEC 任务。实验结果表明,所提 CSA 模型能有效提升当前最先进深度学习算法的性能。

关键词

引用

@article{arxiv.1912.12011,
  title  = {Cross-scale Attention Model for Acoustic Event Classification},
  author = {Xugang Lu and Peng Shen and Sheng Li and Yu Tsao and Hisashi Kawai},
  journal= {arXiv preprint arXiv:1912.12011},
  year   = {2020}
}