中文

SOA: 面向低资源ASR的语音专用适配方法以减少自监督学习流程中的领域失配

音频与语音处理 2024-06-18 v1 声音

摘要

近年来,语音基础模型因其在下游ASR任务微调中的优越性而广受欢迎。然而,在特定领域(如LibriSpeech,成人朗读语音)上微调的模型,在其他领域(如儿童语音或噪声语音)上表现不佳。一种解决方案是收集尽可能多的带标签的多样化数据,以在多个领域上进行联合微调。然而,收集目标领域的语音-文本配对数据并重新训练模型通常成本高昂且计算开销大。本文提出了一种简单而有效的方法,即语音专用适配(SOA),该方法基于语音基础模型(Wav2vec 2.0),仅需来自目标领域的语音输入数据。具体来说,Wav2vec 2.0特征编码器在源领域和目标领域数据上,使用Wav2vec 2.0损失进行持续预训练以实现领域适配,而上下文编码器则被冻结。与在训练期间冻结特征编码器的源领域微调模型相比,我们发现用适配后的特征编码器替换冻结的特征编码器,能在保持源领域性能的同时,显著提升目标领域的词错误率(WER)。SOA的有效性在多种低资源或领域失配的ASR设置中得到了验证,包括成人-儿童语音和干净-噪声语音。

关键词

引用

@article{arxiv.2406.10512,
  title  = {SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR},
  author = {Natarajan Balaji Shankar and Ruchao Fan and Abeer Alwan},
  journal= {arXiv preprint arXiv:2406.10512},
  year   = {2024}
}

备注

Accepted to ICASSP 2024 SASB Workshop