pMCT:用于鲁棒语音识别的补丁多条件训练
音频与语音处理
2022-07-12 v1 声音
摘要
我们提出一种新颖的用于鲁棒自动语音识别(ASR)的补丁多条件训练(pMCT)方法。pMCT 通过混合从干净和失真语音中提取的同一语句的{\it 补丁},采用多条件音频修改与补丁化(MAMP)。使用补丁修改信号进行训练提升了模型在含噪混响场景中的鲁棒性。我们提出的 pMCT 在 LibriSpeech 数据集上进行了评估,显示出优于使用普通多条件训练(MCT)的效果。为分析鲁棒 ASR,我们在 VOiCES 数据集上采用 pMCT,该数据集是使用 LibriSpeech 语句创建的含噪混响数据集。在分析中,pMCT 相比 MCT 实现了 23.1% 的相对词错率降低。
引用
@article{arxiv.2207.04949,
title = {pMCT: Patched Multi-Condition Training for Robust Speech Recognition},
author = {Pablo Peso Parada and Agnieszka Dobrowolska and Karthikeyan Saravanan and Mete Ozay},
journal= {arXiv preprint arXiv:2207.04949},
year = {2022}
}
备注
Accepted at Interspeech 2022