端到端流式关键词 spotting
计算与语言
2019-02-19 v2
摘要
我们提出了一种关键词 spotting 系统,除用于特征生成的前端组件外,该系统完全包含在一个深度神经网络(DNN)模型中,该模型以“端到端”方式训练,用于预测音频流中关键词的出现。本工作的主要贡献在于:首先,一种高效的带记忆机制的神经网络拓扑结构,其旨在通过保存分布于 DNN 深度的先前激活值记忆,更好地利用 DNN 中的参数及相关计算。第二个贡献是一种端到端训练 DNN 以产生关键词 spotting 分数的方法。该系统在检测质量以及模型规模与计算量方面均显著优于先前的方法。
引用
@article{arxiv.1812.02802,
title = {End-to-End Streaming Keyword Spotting},
author = {Alvarez Raziel and Park Hyun-Jin},
journal= {arXiv preprint arXiv:1812.02802},
year = {2019}
}
备注
Accepted in International Conference on Acoustics, Speech, and Signal Processing 2019