用于语音指令识别的神经注意力模型
音频与语音处理
2018-08-28 v1 声音
摘要
本文提出了一种带注意力的卷积循环网络用于语音指令识别。注意力模型是提升自然语言、图像描述以及语音任务性能的强有力工具。所提模型在 Google Speech Commands 数据集 V1 上取得了 94.1% 的新最优准确率,在 V2 上(针对 20 条指令识别任务)取得了 94.5% 的准确率,同时仍保持仅 202K 可训练参数的小体量。结果在 5 个不同任务(20 条指令识别(V1 和 V2)、12 条指令识别(V1)、35 词识别(V1)以及左右(V1))上与先前的卷积实现进行了比较。我们展示了详细的性能结果,并证明所提注意力机制不仅提升了性能,还允许检查网络在输出给定类别时考虑了音频的哪些区域。
引用
@article{arxiv.1808.08929,
title = {A neural attention model for speech command recognition},
author = {Douglas Coimbra de Andrade and Sabato Leo and Martin Loesener Da Silva Viana and Christoph Bernkopf},
journal= {arXiv preprint arXiv:1808.08929},
year = {2018}
}