中文

用于设备端连续语音识别的低维瓶颈特征

音频与语音处理 2018-11-02 v1 机器学习 声音 机器学习

摘要

低功耗数字信号处理器(DSP)通常具有非常有限的可用于缓存数据的存储器。本文开发了可在 DSP 上运行的高效瓶颈特征(BNF)提取器,并重新训练了一个基线大词汇连续语音识别(LVCSR)系统以使用这些 BNF,仅造成最小的精度损失。小型 BNF 使 DSP 芯片能够在主应用处理器挂起时缓存更多音频特征,从而降低整体电池消耗。我们提出的系统能够将标准定点 DSP 频谱特征的占用减少 10 倍而无任何词错误率(WER)损失,减少 64 倍而相对 WER 仅增加 5.8%。

关键词

引用

@article{arxiv.1811.00006,
  title  = {Low-Dimensional Bottleneck Features for On-Device Continuous Speech Recognition},
  author = {David B. Ramsay and Kevin Kilgour and Dominik Roblek and Matthew Sharifi},
  journal= {arXiv preprint arXiv:1811.00006},
  year   = {2018}
}

备注

Submitted to ICASSP 2019