中文

具有快慢级联编码器的流式并行 Transducer 束搜索

计算与语言 2022-03-30 v1 声音 音频与语音处理

摘要

许多语音识别应用需要具有严格延迟约束的流式 ASR。为实现所需延迟,由于缺乏未来输入上下文,流式 ASR 模型相较于非流式 ASR 模型会牺牲准确率。先前研究表明,RNN Transducer 的流式与非流式 ASR 可通过级联因果与非因果编码器来统一。本工作在此外级联编码器框架上做出改进,利用两个具有可变输入上下文尺寸且能以不同音频间隔(如快与慢)产生输出的流式非因果编码器。我们提出了一种新颖的用于 Transducer 的并行时间同步束搜索算法,该算法从快慢编码器解码,其中慢编码器纠正快编码器产生的错误。所提算法在公开 Librispeech 数据集与内部数据集上以词符发射延迟的轻微增加实现了高达 20% 的 WER 降低。我们还探索了通过在处理上于快慢编码器间分配来降低计算量的技术。最后,我们探索了在快编码器中共享参数以减小内存占用。这使得边缘设备上能以低计算成本与低内存占用实现低延迟处理。

关键词

引用

@article{arxiv.2203.15773,
  title  = {Streaming parallel transducer beam search with fast-slow cascaded encoders},
  author = {Jay Mahadeokar and Yangyang Shi and Ke Li and Duc Le and Jiedan Zhu and Vikas Chandra and Ozlem Kalinli and Michael L Seltzer},
  journal= {arXiv preprint arXiv:2203.15773},
  year   = {2022}
}

备注

5 pages, 2 figures, Interspeech 2022 submission