中文

噪声环境下端到端语音识别系统的说话人自适应

声音 2023-12-08 v3 音频与语音处理

摘要

我们分析了基于transformer和wav2vec 2.0的端到端自动语音识别模型在不同噪声条件下说话人自适应的影响。通过引入从x-vector和ECAPA-TDNN系统以及i-vector获得的说话人嵌入,我们在LibriSpeech上取得了最高16.3%的相对词错误率提升,在Switchboard上取得了最高14.5%的相对词错误率提升。我们表明,将说话人向量与声学特征拼接并作为辅助模型输入这一已被验证的方法,仍是提升端到端架构鲁棒性的可行选择。当向输入语音中添加更多噪声时,对transformer模型的影响更强。基于wav2vec 2.0的系统最显著的收益是在中等或无噪声条件下取得的。x-vector和ECAPA-TDNN嵌入作为说话人表征均优于i-vector。最优嵌入维度取决于数据集,并且随噪声条件变化。

关键词

引用

@article{arxiv.2211.08774,
  title  = {Speaker Adaptation for End-To-End Speech Recognition Systems in Noisy Environments},
  author = {Dominik Wagner and Ilja Baumann and Sebastian P. Bayerl and Korbinian Riedhammer and Tobias Bocklet},
  journal= {arXiv preprint arXiv:2211.08774},
  year   = {2023}
}

备注

Accepted at ASRU 2023