中文

动态编码器转导器:一种在精度与延迟间灵活权衡的解决方案

计算与语言 2021-04-07 v1

摘要

我们提出了一种用于设备端语音识别的动态编码器转导器(DET)。一个 DET 模型可扩展至具有不同计算能力的多种设备,无需重新训练或微调。为了在精度与延迟之间权衡,DET 为话语的不同部分分配不同的编码器进行解码。我们应用并比较了层丢弃和协同学习用于 DET 训练。在训练阶段随机丢弃编码器层的层丢弃方法,可在解码时按需进行层丢弃。协同学习在单一模型中联合训练具有不同深度的多个编码器。在 Librispeech 和内部数据上的实验结果表明,DET 提供了灵活的精度与延迟权衡。Librispeech 上的结果显示,DET 中的全尺寸编码器将同等规模基线的词错误率相对降低了超过 8%。DET 中经协同学习训练的轻量编码器将模型尺寸减小了 25%,但仍取得与全尺寸基线相似的 WER。DET 通过为话语起始部分分配轻量编码器、其余部分分配全尺寸编码器,在大型内部数据集上取得了与基线模型相似的精度且具备更优延迟。

关键词

引用

@article{arxiv.2104.02176,
  title  = {Dynamic Encoder Transducer: A Flexible Solution For Trading Off Accuracy For Latency},
  author = {Yangyang Shi and Varun Nagaraja and Chunyang Wu and Jay Mahadeokar and Duc Le and Rohit Prabhavalkar and Alex Xiao and Ching-Feng Yeh and Julian Chan and Christian Fuegen and Ozlem Kalinli and Michael L. Seltzer},
  journal= {arXiv preprint arXiv:2104.02176},
  year   = {2021}
}

备注

5 pages, 2 figures, submitted Interspeech 2021