面向域不变语音识别的大规模训练方法
计算与语言
2019-10-28 v1 音频与语音处理
摘要
当前最先进的自动语音识别系统被训练为在特定“域”中工作,这些域基于应用、采样率和编解码器等因素定义。当此类识别器用于与训练域不匹配的条件时,性能显著下降。本工作探索通过合并来自多个应用领域的大规模训练数据,构建适用于不同用例的单一域不变模型。我们的最终系统使用 162,000 小时语音进行训练。此外,训练期间每条语音都被人为失真以模拟背景噪声、编解码器失真和采样率等效应。我们的结果表明,即便在如此规模下,这样训练的模型几乎与针对特定子集微调的模型表现一样好:单一模型可对多个应用领域以及编解码器和噪声等变化具有鲁棒性。更重要的是,此类模型对未见条件泛化更好,并允许快速适配——我们展示通过使用来自新域少至 10 小时的数据,适配后的域不变模型可匹配使用多 70 倍数据从头训练的域特定模型的性能。我们也强调了此类模型的一些局限性和未来工作中需要解决的方面。
引用
@article{arxiv.1808.05312,
title = {Toward domain-invariant speech recognition via large scale training},
author = {Arun Narayanan and Ananya Misra and Khe Chai Sim and Golan Pundak and Anshuman Tripathi and Mohamed Elfeky and Parisa Haghani and Trevor Strohman and Michiel Bacchiani},
journal= {arXiv preprint arXiv:1808.05312},
year = {2019}
}