中文

自注意力机制对声音事件定位与检测中学习特征的影响评估

声音 2021-09-28 v2 音频与语音处理

摘要

联合声音事件定位与检测(SELD)是一项新兴的音频信号处理任务,为声学场景分析和声音事件检测增添了空间维度。对 SELD 进行联合建模的一种流行方法是使用卷积循环神经网络(CRNN)模型,其中 CNN 从多通道音频输入中学习高级特征,RNN 从这些高级特征中学习时间关系。然而,RNN 存在一些缺点,例如建模长时间依赖的能力有限,以及由于其顺序处理特性导致的训练和推理速度慢。最近,一些 SELD 研究在其模型中使用了多头自注意力(MHSA)及其他创新。MHSA 及相关的 transformer 网络已在多个领域展现出最先进的性能。虽然它们可以建模长时间依赖,也可以高效并行化。本文中,我们详细研究了 MHSA 对 SELD 任务的影响。具体而言,我们考察了用自注意力层替换 RNN 块的效果。我们研究了堆叠多个自注意力块、在每个自注意力块中使用多个注意力头、以及位置嵌入和层归一化效果的影响。在 DCASE 2021 SELD(任务 3)开发数据集上的评估显示,与伴随该任务的基线 CRNN 相比,所有采用的指标均有显著改进。

关键词

引用

@article{arxiv.2107.09388,
  title  = {Assessment of Self-Attention on Learned Features For Sound Event Localization and Detection},
  author = {Parthasaarathy Sudarsanam and Archontis Politis and Konstantinos Drossos},
  journal= {arXiv preprint arXiv:2107.09388},
  year   = {2021}
}