中文

SpeechNet:弱监督、端到端的大规模工业级语音识别

计算与语言 2022-11-22 v1 声音 音频与语音处理

摘要

端到端自动语音识别系统代表了当前最先进水平,但它们依赖数千小时的人工标注语音进行训练,并且推理时需要大量计算资源。这当然阻碍了商业化,因为大多数公司缺乏庞大的人力和计算资源。在本文中,我们探索在标注稀缺、计算受限的环境下训练和部署 ASR 系统。为减少人力劳动,我们使用第三方 ASR 系统作为弱监督来源,并辅以从隐式用户反馈中导出的标注函数。为加速推理,我们提出将生产时的查询路由到一个具有不同输入长度的 CUDA 图池中,其分布与流量分布最为匹配。相比我们的第三方 ASR,我们实现了词错误率相对降低 8% 以及加速 600%。我们的系统称为 SpeechNet,目前在我们的语音智能电视上每天服务 1200 万次查询。据我们所知,这是学术文献中首次描述基于 Wav2vec 的大规模部署。

关键词

引用

@article{arxiv.2211.11740,
  title  = {SpeechNet: Weakly Supervised, End-to-End Speech Recognition at Industrial Scale},
  author = {Raphael Tang and Karun Kumar and Gefei Yang and Akshat Pandey and Yajie Mao and Vladislav Belyaev and Madhuri Emmadi and Craig Murray and Ferhan Ture and Jimmy Lin},
  journal= {arXiv preprint arXiv:2211.11740},
  year   = {2022}
}

备注

Accepted to EMNLP 2022 Industry Track; 9 pages, 7 figures