中文

极端编码器输出帧率降低:改善大型端到端模型的计算延迟

计算与语言 2024-02-28 v1 声音 音频与语音处理

摘要

端到端(E2E)自动语音识别(ASR)模型的准确性随着模型规模扩大而持续提升,有些模型参数已达数十亿。然而,这些模型的广泛部署和采用需要计算高效的解码策略。在本文中,我们研究了一种策略:在编码器中应用多个帧缩减层,将编码器输出压缩为少量输出帧。虽然类似技术已在先前工作中被研究,但我们通过使用多个漏斗缩减层实现了比以往演示更显著的缩减。通过消融实验,我们研究了编码器中各种架构选择的影响,以确定最有效的策略。我们证明,可以在每2.56秒输入语音生成一个编码器输出帧,而在大规模语音搜索任务上词错误率没有显著影响,同时相对于强大但计算昂贵的基线,编码器和解码器延迟分别改善了48%和92%。

关键词

引用

@article{arxiv.2402.17184,
  title  = {Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models},
  author = {Rohit Prabhavalkar and Zhong Meng and Weiran Wang and Adam Stooke and Xingyu Cai and Yanzhang He and Arun Narayanan and Dongseong Hwang and Tara N. Sainath and Pedro J. Moreno},
  journal= {arXiv preprint arXiv:2402.17184},
  year   = {2024}
}

备注

Accepted to 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2024)