中文

基于流式 Transformers 的唤醒词检测

计算与语言 2021-02-10 v1 声音 音频与语音处理

摘要

现代唤醒词检测系统通常依赖神经网络进行声学建模。Transformer 凭借更强的时序建模能力,近期在各种序列建模任务中展现出优于 LSTM 和卷积网络的性能。然而,这一优势在唤醒词检测等短程时序建模中是否依然成立尚不清楚。此外,原始 Transformer 因其非流式特性及时间与空间复杂度的二次方增长,无法直接应用于该任务。本文在近期提出的 LF-MMI 系统中,探究了几种为唤醒词检测定制的分块流式 Transformer 变体性能,包括前瞻下一分块、梯度截断、不同位置嵌入方法以及添加分块间同层依赖。在 Mobvoi 唤醒词数据集上的实验表明,我们提出的 Transformer 模型在相同误报率下,以可比模型规模将误拒率平均较基线卷积网络降低25%,同时保持相对于序列长度的线性复杂度。

关键词

引用

@article{arxiv.2102.04488,
  title  = {Wake Word Detection with Streaming Transformers},
  author = {Yiming Wang and Hang Lv and Daniel Povey and Lei Xie and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2102.04488},
  year   = {2021}
}

备注

Accepted at IEEE ICASSP 2021. 5 pages, 3 figures