DRAFT:一种减少自监督学习中域偏移的新框架及其在儿童语音识别中的应用
音频与语音处理
2022-06-17 v1 声音
摘要
在预训练阶段使用无标注语音数据的自监督学习(SSL)已在低资源自动语音识别(ASR)任务中取得成功。然而,通过SSL训练的模型偏向于预训练数据,而预训练数据通常与微调任务所用数据不同,导致域偏移问题,从而限制了知识迁移。我们提出一种新框架,即域负责适配与微调(DRAFT),通过额外的适配阶段来减少预训练语音模型中的域偏移。在DRAFT中,将残差适配器(RAs)插入预训练模型,以与预训练阶段相同的SSL损失学习域相关信息。在适配阶段仅更新RA参数。DRAFT与所用SSL方法类型无关,并使用三种广泛使用的方法进行评估:APC、Wav2vec2.0和HuBERT。在两个儿童ASR任务(OGI和MyST数据库)上,使用由无标注成人语音数据(Librispeech)训练的SSL模型,与未经适配的预训练模型相比,观察到高达19.7%的相对词错率(WER)改善。额外实验考察了这两个数据集之间跨知识迁移的潜力,结果令人鼓舞,显示出所提DRAFT框架更广阔的使用前景。
引用
@article{arxiv.2206.07931,
title = {DRAFT: A Novel Framework to Reduce Domain Shifting in Self-supervised Learning and Its Application to Children's ASR},
author = {Ruchao Fan and Abeer Alwan},
journal= {arXiv preprint arXiv:2206.07931},
year = {2022}
}
备注
Accepted to Interspeech 2022