中文

实时因子低于 0.01 的极快关键词 spotting 系统

音频与语音处理 2020-09-09 v1 声音

摘要

在本文中,我们提出了一种基于现代神经网络的关键词 spotting(KWS)系统架构,该架构在各种语音数据上表现良好且运行极快。我们主要关注最后一方面,并对 KWS 设计所需的所有步骤提出优化:信号处理和似然计算、Viterbi 解码、spot 候选检测与置信度计算。我们提出了通过双向前馈序列记忆网络(循环网络的替代方案)以标准三音子或所谓准单音子进行时空高效的建模,以及对语音帧的完全前向解码(最小程度需要回看)。所提方案的若干变体在 3 个大型捷克语数据集(广播、互联网和电话,共 17 小时)上进行了评估,其性能通过检测错误权衡(DET)图和实时(RT)因子进行比较。我们证明,若应用所有优化(包括用于似然计算的 GPU),完整系统可以单遍运行且 RT 因子接近 0.001。

关键词

引用

@article{arxiv.2007.10706,
  title  = {Very Fast Keyword Spotting System with Real Time Factor below 0.01},
  author = {Jan Nouza and Petr Cerva and Jindrich Zdansky},
  journal= {arXiv preprint arXiv:2007.10706},
  year   = {2020}
}

备注

11 pages, 3 figures