面向 CHiME-6 晚宴转录的竞争性端到端语音识别
音频与语音处理
2020-11-02 v3 计算与语言
机器学习
声音
摘要
尽管端到端 ASR 系统已被证明可与传统混合方法竞争,但在噪声和低资源条件下其准确率容易出现退化。在本文中,我们论证即使在此类困难情况下,某些端到端方法也展现出接近混合基线的性能。为说明这一点,我们使用 CHiME-6 挑战赛数据作为日常语音中困难环境与噪声条件的示例。我们通过实验比较并分析了 CTC-Attention 与 RNN-Transducer 方法,以及 RNN 与 Transformer 架构。我们还提供了声学特征与语音增强的对比。此外,我们评估了神经网络语言模型在低资源条件下用于假设重打分的有效性。我们基于 RNN-Transducer 的最佳端到端模型,结合改进的束搜索,仅以比 LF-MMI TDNN-F CHiME-6 挑战赛基线差 3.8% WER abs. 的质量达到。借助基于引导源分离的训练数据增强,该方法以 2.7% WER abs. 优于混合基线系统,并以 25.7% WER abs. 优于此前已知最佳的端到端系统。
引用
@article{arxiv.2004.10799,
title = {Towards a Competitive End-to-End Speech Recognition for CHiME-6 Dinner Party Transcription},
author = {Andrei Andrusenko and Aleksandr Laptev and Ivan Medennikov},
journal= {arXiv preprint arXiv:2004.10799},
year = {2020}
}
备注
Accepted by Interspeech 2020