中文

重新思考 ASR 中的评估:我们的模型是否足够鲁棒?

机器学习 2021-05-04 v3 计算与语言 声音 音频与语音处理

摘要

在自动语音识别中,在单一基准上刷指标是否有价值?声学建模的研究结果通常基于在单一数据集上的表现进行评估。尽管研究界已围绕多个基准形成共识,我们着手理解声学建模跨数据集的泛化性能——具体而言,在单一数据集上训练的模型是否能迁移到其他(可能为域外)数据集。我们表明,一般而言,混响与加性噪声增强能改善跨域泛化性能。进一步,我们证明当使用足够大规模的一组基准时,它们在平均词错误率(WER)上的表现可作为真实世界噪声数据性能的良好代理。最后,我们展示在应用最广泛的数据集组合上训练单一声学模型,可在研究与真实世界基准上均达到有竞争力的性能。

关键词

引用

@article{arxiv.2010.11745,
  title  = {Rethinking Evaluation in ASR: Are Our Models Robust Enough?},
  author = {Tatiana Likhomanenko and Qiantong Xu and Vineel Pratap and Paden Tomasello and Jacob Kahn and Gilad Avidov and Ronan Collobert and Gabriel Synnaeve},
  journal= {arXiv preprint arXiv:2010.11745},
  year   = {2021}
}