不要停止自监督:通过残差适配器实现语音表征的口音自适应
计算与语言
2023-07-04 v1 声音
音频与语音处理
摘要
从大规模无标注语音语料库中以自监督方式学习到的语音表征已成功适配于若干下游任务。然而,此类表征可能偏向这些语料库的典型数据特征,并在非典型的非母语口音说话人族群上表现不佳。我们以最先进的HuBERT模型为基线,提出并研究以参数高效的方式通过训练特定口音残差适配器将语音表征自监督地适配于此类族群。我们针对4种口音进行实验,并选择自动语音识别(ASR)作为关注的下游任务。相较于HuBERT-large,我们在全部4种口音上均获得了显著的词错误率降低(WERR),使用特定口音适配器时平均WERR为22.7%,若对整个编码器进行口音适配则平均WERR为25.1%。尽管我们的实验使用HuBERT和ASR作为下游任务,我们提出的方法对模型和任务均无关。
引用
@article{arxiv.2307.00453,
title = {Don't Stop Self-Supervision: Accent Adaptation of Speech Representations via Residual Adapters},
author = {Anshu Bhatia and Sanchit Sinha and Saket Dingliwal and Karthik Gopalakrishnan and Sravan Bodapati and Katrin Kirchhoff},
journal= {arXiv preprint arXiv:2307.00453},
year = {2023}
}