中文

pMCT:用于鲁棒语音识别的补丁多条件训练

音频与语音处理 2022-07-12 v1 声音

摘要

我们提出一种新颖的用于鲁棒自动语音识别(ASR)的补丁多条件训练(pMCT)方法。pMCT 通过混合从干净和失真语音中提取的同一语句的{\it 补丁},采用多条件音频修改与补丁化(MAMP)。使用补丁修改信号进行训练提升了模型在含噪混响场景中的鲁棒性。我们提出的 pMCT 在 LibriSpeech 数据集上进行了评估,显示出优于使用普通多条件训练(MCT)的效果。为分析鲁棒 ASR,我们在 VOiCES 数据集上采用 pMCT,该数据集是使用 LibriSpeech 语句创建的含噪混响数据集。在分析中,pMCT 相比 MCT 实现了 23.1% 的相对词错率降低。

关键词

引用

@article{arxiv.2207.04949,
  title  = {pMCT: Patched Multi-Condition Training for Robust Speech Recognition},
  author = {Pablo Peso Parada and Agnieszka Dobrowolska and Karthikeyan Saravanan and Mete Ozay},
  journal= {arXiv preprint arXiv:2207.04949},
  year   = {2022}
}

备注

Accepted at Interspeech 2022