中文

BCN2BRNO:面向 Albayzin 2020 语音转文本挑战赛的 ASR 系统融合

音频与语音处理 2021-02-01 v1 计算与语言

摘要

本文描述了布尔诺理工大学(BUT)与 Telefónica 研究院为开发 Albayzin 2020 挑战赛自动语音识别(ASR)系统所做的联合努力。我们比较了基于混合模型或端到端模型的方法。在混合建模中,我们探究了 SpecAugment 层对性能的影响。对于端到端建模,我们使用了带门控线性单元(GLUs)的卷积神经网络。该模型的性能还通过在额外 n-gram 语言模型下的评估来改进词错误率。我们进一步考察了源分离方法以从噪声环境(即电视节目)中提取语音。更确切地说,我们评估了使用名为 Demucs 的基于神经网络的音乐分离器的效果。我们最佳系统的融合在 Albayzin 2020 官方评测中取得了 23.33% 的词错误率(WER)。除最终提交系统中使用的技术外,我们还描述了在获取高质量训练转写文本方面的努力。

关键词

引用

@article{arxiv.2101.12729,
  title  = {BCN2BRNO: ASR System Fusion for Albayzin 2020 Speech to Text Challenge},
  author = {Martin Kocour and Guillermo Cámbara and Jordi Luque and David Bonet and Mireia Farrús and Martin Karafiát and Karel Veselý and Jan ''Honza'' Ĉernocký},
  journal= {arXiv preprint arXiv:2101.12729},
  year   = {2021}
}

备注

fusion, end-to-end model, hybrid model, semisupervised, automatic speech recognition, convolutional neural network