中文

Transformer 实战:面向大规模语音识别应用的基于 Transformer 声学模型的比较研究

计算与语言 2020-11-02 v2 声音

摘要

在本文中,我们总结了 Transformer 及其流式变体 Emformer 声学模型在大规模语音识别应用中的情况。我们在工业级任务上将基于 Transformer 的声学模型与其 LSTM 对应模型进行了比较。具体而言,我们在中等延迟任务上将 Emformer 与延迟控制的双向长短期记忆网络(LCBLSTM)进行比较,并在低延迟任务上与 LSTM 进行比较。在低延迟语音助手任务上,Emformer 获得了 24% 至 26% 的相对词错率降低(WERRs)。对于中等延迟场景,在模型大小和延迟相似的情况下,与 LCBLSTM 相比,Emformer 在视频字幕数据集的四种语言中均获得了显著的 WERR,且推理实时率降低了 2 至 3 倍。

关键词

引用

@article{arxiv.2010.14665,
  title  = {Transformer in action: a comparative study of transformer-based acoustic models for large scale speech recognition applications},
  author = {Yongqiang Wang and Yangyang Shi and Frank Zhang and Chunyang Wu and Julian Chan and Ching-Feng Yeh and Alex Xiao},
  journal= {arXiv preprint arXiv:2010.14665},
  year   = {2020}
}

备注

submitted to ICASSP2021