中文

基于解码端自适应计算步长的 Transformer 在线语音识别

音频与语音处理 2020-11-30 v1

摘要

基于 Transformer 的端到端(E2E)自动语音识别(ASR)系统近年来广受欢迎,并被证明在多项 ASR 任务上优于基于循环结构的 E2E 模型。然而,与其他 E2E 模型类似,Transformer ASR 也需要完整输入序列来计算编码器与解码器上的注意力,导致延迟增加并对在线 ASR 构成挑战。本文提出解码端自适应计算步长(DACS)算法以解决延迟问题并促进在线 ASR。所提算法通过在编码器状态获取的置信度达到某一阈值后触发输出,从而对 Transformer ASR 的解码进行流式处理。与其他可能为每个输出步访问全部编码器状态的单调注意力机制不同,本文在 DACS 算法中引入最大前瞻步长以防止过快到达语音末尾。我们的系统采用分块编码器来处理实时语音输入。所提在线 Transformer ASR 系统在 Wall Street Journal(WSJ)和 AIShell-1 数据集上分别取得了 5.5% 的词错误率(WER)和 7.1% 的字错误率(CER),与离线系统相比性能仅有轻微下降。

关键词

引用

@article{arxiv.2011.13834,
  title  = {Transformer-based Online Speech Recognition with Decoder-end Adaptive Computation Steps},
  author = {Mohan Li and Catalin Zorila and Rama Doddipatla},
  journal= {arXiv preprint arXiv:2011.13834},
  year   = {2020}
}

备注

7 pages, 1 figure, accepted at SLT 2021