基于Wav2vec2的构音障碍ASR说话人自适应
声音
2022-04-05 v1 人工智能
机器学习
音频与语音处理
摘要
由于训练数据缺乏以及说话人特征间的严重不匹配,构音障碍语音识别带来了重大挑战。最近的ASR系统已受益于现成可用的预训练模型(如wav2vec2)来提升识别性能。使用fMLLR和xvectors的说话人自适应以极少的自适应数据为构音障碍语音带来了主要增益。然而,在wav2vec2微调期间将wav2vec2与fMLLR特征或xvectors集成尚待探索。在本工作中,我们提出一种简单的自适应网络,用于使用fMLLR特征微调wav2vec2。该自适应网络也能灵活处理其他说话人自适应特征如xvectors。实验分析显示,我们提出的方法在所有障碍严重程度上均取得稳定改进,并在UASpeech数据集上对高严重度达到57.72% WER。我们还在德语数据集上进行了实验,以证实我们所提方法在不同领域间的一致性。
引用
@article{arxiv.2204.00770,
title = {Speaker adaptation for Wav2vec2 based dysarthric ASR},
author = {Murali Karthick Baskar and Tim Herzig and Diana Nguyen and Mireia Diez and Tim Polzehl and Lukáš Burget and Jan "Honza'' Černocký},
journal= {arXiv preprint arXiv:2204.00770},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022