基于 WavAugment 引导音素对抗训练的鲁棒自动语音识别
声音
2023-07-25 v1 计算与语言
音频与语音处理
摘要
开发实际鲁棒的自动语音识别(ASR)具有挑战性,因为模型不仅应在干净样本上保持原有性能,还应在小音量扰动和大域偏移下取得一致效果。为解决该问题,我们提出一种新颖的 WavAugment 引导音素对抗训练(wapat)。wapat 使用音素空间中的对抗样本作为增强,使模型对音素表示中的微小波动保持不变,并保持在干净样本上的性能。此外,wapat 利用增强样本的音素表示来引导对抗样本的生成,这有助于找到更稳定且多样的梯度方向,从而提升泛化能力。大量实验证明了 wapat 在端到端语音挑战基准(ESB)上的有效性。值得注意的是,SpeechLM-wapat 在 ESB 上以 6.28% 的 WER 降低优于原始模型,达到了新的 state-of-the-art。
引用
@article{arxiv.2307.12498,
title = {Robust Automatic Speech Recognition via WavAugment Guided Phoneme Adversarial Training},
author = {Gege Qi and Yuefeng Chen and Xiaofeng Mao and Xiaojun Jia and Ranjie Duan and Rong Zhang and Hui Xue},
journal= {arXiv preprint arXiv:2307.12498},
year = {2023}
}