用于设备端连续语音识别的低维瓶颈特征
音频与语音处理
2018-11-02 v1 机器学习
声音
机器学习
摘要
低功耗数字信号处理器(DSP)通常具有非常有限的可用于缓存数据的存储器。本文开发了可在 DSP 上运行的高效瓶颈特征(BNF)提取器,并重新训练了一个基线大词汇连续语音识别(LVCSR)系统以使用这些 BNF,仅造成最小的精度损失。小型 BNF 使 DSP 芯片能够在主应用处理器挂起时缓存更多音频特征,从而降低整体电池消耗。我们提出的系统能够将标准定点 DSP 频谱特征的占用减少 10 倍而无任何词错误率(WER)损失,减少 64 倍而相对 WER 仅增加 5.8%。
引用
@article{arxiv.1811.00006,
title = {Low-Dimensional Bottleneck Features for On-Device Continuous Speech Recognition},
author = {David B. Ramsay and Kevin Kilgour and Dominik Roblek and Matthew Sharifi},
journal= {arXiv preprint arXiv:1811.00006},
year = {2018}
}
备注
Submitted to ICASSP 2019