Wav2vec-S:面向低资源语音识别的半监督预训练
音频与语音处理
2022-06-20 v2 计算与语言
声音
摘要
自监督预训练可有效提升低资源自动语音识别(ASR)的性能。然而,现有的自监督预训练是任务无关的,即可应用于多种下游任务。尽管这扩大了其应用范围,但预训练模型的容量并未被ASR任务充分利用,且所学表征对ASR可能并非最优。本工作中,为构建更好的低资源ASR预训练模型,我们提出一种称为wav2vec-S的预训练方法,其中采用任务特定的半监督预训练来精炼自监督预训练模型以适配ASR任务,从而更有效地利用预训练模型容量生成面向ASR的任务特定表征。实验表明,与wav2vec 2.0相比,wav2vec-S仅需要极少的预训练时间增量,却能在域内、跨域和跨语言数据集上显著提升ASR性能。在1小时和10小时微调下,平均相对词错率(WER)降低分别为24.5%和6.6%。此外,我们通过典型相关分析表明,半监督预训练可缩小自监督预训练模型与相应微调模型之间的表征差距。
引用
@article{arxiv.2110.04484,
title = {Wav2vec-S: Semi-Supervised Pre-Training for Low-Resource ASR},
author = {Han Zhu and Li Wang and Jindong Wang and Gaofeng Cheng and Pengyuan Zhang and Yonghong Yan},
journal= {arXiv preprint arXiv:2110.04484},
year = {2022}
}
备注
Accepted by Interspeech 2022