中文

基于 WavAugment 引导音素对抗训练的鲁棒自动语音识别

声音 2023-07-25 v1 计算与语言 音频与语音处理

摘要

开发实际鲁棒的自动语音识别(ASR)具有挑战性,因为模型不仅应在干净样本上保持原有性能,还应在小音量扰动和大域偏移下取得一致效果。为解决该问题,我们提出一种新颖的 WavAugment 引导音素对抗训练(wapat)。wapat 使用音素空间中的对抗样本作为增强,使模型对音素表示中的微小波动保持不变,并保持在干净样本上的性能。此外,wapat 利用增强样本的音素表示来引导对抗样本的生成,这有助于找到更稳定且多样的梯度方向,从而提升泛化能力。大量实验证明了 wapat 在端到端语音挑战基准(ESB)上的有效性。值得注意的是,SpeechLM-wapat 在 ESB 上以 6.28% 的 WER 降低优于原始模型,达到了新的 state-of-the-art。

关键词

引用

@article{arxiv.2307.12498,
  title  = {Robust Automatic Speech Recognition via WavAugment Guided Phoneme Adversarial Training},
  author = {Gege Qi and Yuefeng Chen and Xiaofeng Mao and Xiaojun Jia and Ranjie Duan and Rong Zhang and Hui Xue},
  journal= {arXiv preprint arXiv:2307.12498},
  year   = {2023}
}