用于语音关键词识别的多层注意力机制
机器学习
2019-07-11 v1 声音
音频与语音处理
机器学习
摘要
作为语音识别技术的重要组成部分,自动语音关键词识别近年来得到深入研究。在基础设施和计算资源受限的情况下,例如车载语音指令识别和机器人交互,此类技术尤为关键。目前,自动语音关键词识别的主流方法基于带注意力机制的长短期记忆(LSTM)网络。然而,由于LSTM层在特征提取过程中不可避免的信息损失,计算出的注意力权重存在偏差。本文提出一种新方法,即多层注意力机制,以解决注意力权重不准确的问题。其核心思想是,除常规注意力机制外,将特征提取和LSTM之前的各层信息引入注意力权重计算。因此,由于整体模型可拥有更精确且聚焦的区域,注意力权重更为准确。我们在Google Speech Command V2数据集上,对卷积神经网络、双向LSTM循环神经网络以及采用所提注意力机制的循环神经网络的关键词 spotting 性能进行了全面比较与分析。实验结果表明所提方法性能优越,并验证了方法的有效性。所提多层注意力方法可有益于其他与对象 spotting 相关的研究。
引用
@article{arxiv.1907.04536,
title = {Multi-layer Attention Mechanism for Speech Keyword Recognition},
author = {Ruisen Luo and Tianran Sun and Chen Wang and Miao Du and Zuodong Tang and Kai Zhou and Xiaofeng Gong and Xiaomei Yang},
journal= {arXiv preprint arXiv:1907.04536},
year = {2019}
}