中文

Emformer:基于高效记忆Transformer的低延迟流式语音识别声学模型

声音 2021-01-01 v4 计算与语言 机器学习 音频与语音处理

摘要

本文提出一种用于低延迟流式语音识别的高效记忆Transformer——Emformer。在Emformer中,长距离历史上下文被提炼至增强记忆库中以降低自注意力的计算复杂度。一种缓存机制为左上下文的自注意力中的键和值节省计算。Emformer在训练中采用并行块处理以支持低延迟模型。我们在基准LibriSpeech数据上开展实验。在960 ms平均延迟下,Emformer在test-clean上取得WER 2.50%2.50\%,在test-other上取得 5.62%5.62\%。与强基线增强记忆Transformer(AM-TRF)相比,Emformer在test-clean和test-other上分别取得相对WER降低 17%17\%9%9\% 的同时,获得 4.64.6 倍训练加速与解码时 18%18\% 的相对实时因子(RTF)降低。对于平均延迟80 ms的低延迟场景,Emformer在test-clean和test-other上分别达到WER 3.01%3.01\%7.09%7.09\%。与相同延迟和模型大小的LSTM基线相比,Emformer在test-clean和test-other上分别取得相对WER降低 9%9\%16%16\%

关键词

引用

@article{arxiv.2010.10759,
  title  = {Emformer: Efficient Memory Transformer Based Acoustic Model For Low Latency Streaming Speech Recognition},
  author = {Yangyang Shi and Yongqiang Wang and Chunyang Wu and Ching-Feng Yeh and Julian Chan and Frank Zhang and Duc Le and Mike Seltzer},
  journal= {arXiv preprint arXiv:2010.10759},
  year   = {2021}
}

备注

5 pages, 2 figures, submitted to ICASSP 2021