中文

基于有监督与无监督 wav2vec 嵌入的口音鲁棒自动语音识别

音频与语音处理 2021-10-11 v2

摘要

语音识别模型在测试未见口音的语音时性能常出现下降。域对抗训练(DAT)与多任务学习(MTL)是构建口音鲁棒 ASR 模型的两种常用方法。使用口音嵌入的 ASR 模型是另一种提升口音鲁棒性的途径。在本研究中,我们利用大量英语口音语料(4000 小时美式英语语音与 1244 小时 20 种非美式英语口音语音)对 DAT 与 MTL 方法进行了系统比较。我们探索了有监督与无监督设定下训练的嵌入:利用口音标签训练的独立嵌入矩阵,以及从微调 wav2vec 模型提取的嵌入。我们发现,采用有监督嵌入训练的 DAT 模型总体性能最佳,并对所有测试数据集持续带来增益;而采用 wav2vec 嵌入训练的 MTL 模型有助于学习口音不变特征并改善新颖/未见口音。我们还说明,当无口音标签可用于训练有监督嵌入时,wav2vec 嵌入在构建口音鲁棒 ASR 方面更具优势。

关键词

引用

@article{arxiv.2110.03520,
  title  = {Accent-Robust Automatic Speech Recognition Using Supervised and Unsupervised Wav2vec Embeddings},
  author = {Jialu Li and Vimal Manohar and Pooja Chitkara and Andros Tjandra and Michael Picheny and Frank Zhang and Xiaohui Zhang and Yatharth Saraf},
  journal= {arXiv preprint arXiv:2110.03520},
  year   = {2021}
}

备注

Submitted to ICASSP 2022