端到端鲁棒语音识别模型的调查研究
音频与语音处理
2021-02-15 v1 机器学习
声音
摘要
用于鲁棒自动语音识别(ASR)的端到端模型在先前工作中尚未得到充分探索。对于端到端模型,可以选择使用语音增强技术对输入语音进行预处理,并使用增强语音训练模型。另一种替代方案是将带噪语音作为输入并修改模型架构以适应带噪语音。此前尚未尝试对这两种端到端鲁棒 ASR 方法进行系统比较。我们弥补这一空白,并详细比较了基于语音增强的技术和三种不同的基于模型的自适应技术,涵盖数据增强、多任务学习和对抗学习,用于鲁棒 ASR。虽然对抗学习在某些噪声类型上表现最佳,但其代价是干净语音 WER 的下降。在其他相对平稳的噪声类型上,一种新的语音增强技术优于所有基于模型的自适应技术。这表明底层噪声类型的知识可以有针对性地指导自适应技术的选择。
引用
@article{arxiv.2102.06237,
title = {An Investigation of End-to-End Models for Robust Speech Recognition},
author = {Archiki Prasad and Preethi Jyothi and Rajbabu Velmurugan},
journal= {arXiv preprint arXiv:2102.06237},
year = {2021}
}
备注
Accepted to appear at ICASSP 2021