用于声音识别的记忆控制顺序自注意力
音频与语音处理
2020-08-07 v4 机器学习
声音
摘要
本文研究了在声音识别的顺序自注意力中记忆范围的重要性。我们提出在卷积循环神经网络(CRNN)模型之上使用记忆控制顺序自注意力机制用于复音声音事件检测(SED)。在 URBAN-SED 数据集上的实验证明了记忆范围对自注意力诱导的 SED 模型声音识别性能的影响。我们将所提思想扩展为多头自注意力机制,其中每个注意力头以显式的注意力宽度值处理音频嵌入。所提出的记忆控制顺序自注意力的使用提供了一种在声音事件 token 的帧之间引入关联的方式。我们表明,我们的记忆控制自注意力模型在 URBAN-SED 数据集上取得了基于事件的 F 值 33.92%,优于无自注意力模型所报告的 20.10% 的 F 值。
引用
@article{arxiv.2005.06650,
title = {Memory Controlled Sequential Self Attention for Sound Recognition},
author = {Arjun Pankajakshan and Helen L. Bear and Vinod Subramanian and Emmanouil Benetos},
journal= {arXiv preprint arXiv:2005.06650},
year = {2020}
}
备注
Accepted to INTERSPEECH 2020