中文

语音识别无监督预训练中的性能-效率权衡

计算与语言 2021-09-15 v1 机器学习 声音 音频与语音处理

摘要

本文研究了用于自动语音识别(ASR)的预训练模型中的性能-效率权衡。我们聚焦于 wav2vec 2.0,并形式化了若干同时影响模型性能与效率的架构设计。综合我们的所有观察,我们提出了 SEW(Squeezed and Efficient Wav2vec),一种在多种训练设置下于性能和效率两个维度均有显著改进的预训练模型架构。例如,在 LibriSpeech 上的 100h-960h 半监督设置下,SEW 相比 wav2vec 2.0 实现了 1.9 倍的推理加速,且词错误率相对降低 13.5%。在相近推理时间下,SEW 在不同模型规模上使词错误率降低 25-50%。

关键词

引用

@article{arxiv.2109.06870,
  title  = {Performance-Efficiency Trade-offs in Unsupervised Pre-training for Speech Recognition},
  author = {Felix Wu and Kwangyoun Kim and Jing Pan and Kyu Han and Kilian Q. Weinberger and Yoav Artzi},
  journal= {arXiv preprint arXiv:2109.06870},
  year   = {2021}
}

备注

Code available at https://github.com/asappresearch/sew