中文

基于编码器解码器的语音识别中假设与语音向量化以加速集束搜索

声音 2018-11-13 v1 计算与语言 音频与语音处理 机器学习

摘要

基于注意力的编码器解码器网络在推理步骤中使用从左至右的集束搜索算法。当前的集束搜索扩展假设并在下一步遍历扩展的假设。该遍历通常由for循环程序实现,并导致识别过程速度下降。本文中,我们提出一种集束搜索的并行化技术,通过将多个假设向量化以消除for循环程序来加速搜索过程。我们还提出一种对多条语音语句进行批处理以用于离线识别的技术,其减少了关于多条语句遍历的for循环程序。不同于训练阶段,由于高效解码的若干剪枝与阈值技术,该扩展在集束搜索中并非易事。此外,我们的方法可将外部模块RNNLM与CTC的分数作为批处理中的浅融合进行组合。通过假设向量化,我们相较原始集束搜索算法实现了3.7倍加速,并通过进一步将处理单元改为GPU实现了10.5倍加速。

关键词

引用

@article{arxiv.1811.04568,
  title  = {Vectorization of hypotheses and speech for faster beam search in encoder decoder-based speech recognition},
  author = {Hiroshi Seki and Takaaki Hori and Shinji Watanabe},
  journal= {arXiv preprint arXiv:1811.04568},
  year   = {2018}
}