中文

稳定蒸馏:为低资源自动语音识别正则化持续预训练

音频与语音处理 2023-12-21 v1 人工智能 计算与语言 声音

摘要

持续自监督预训练用于将现有自监督学习模型适应目标领域,已被证明对低资源自动语音识别(ASR)极为有效。本文提出稳定蒸馏(Stable Distillation),一种简单新颖的基于自监督学习的持续预训练方法,可在标记和未标记数据均有限的目标领域中提升ASR性能。稳定蒸馏采用自蒸馏作为持续预训练的正则化,缓解了过拟合问题——这是当源域和目标域不同时持续预训练面临的常见问题。具体地,首先,我们在目标领域ASR数据集上对初始自监督预训练模型进行普通持续预训练,并将其称为教师模型。接着,我们将相同的初始预训练模型作为学生模型进行持续预训练,同时强制其隐藏表示接近教师模型的隐藏表示(通过均方误差损失)。然后,该学生模型用于目标数据集上的下游ASR微调。在实践中,稳定蒸馏在各种实验设置下评估时,比所有基线模型的词错误率(WER)低0.8-7。

关键词

引用

@article{arxiv.2312.12783,
  title  = {Stable Distillation: Regularizing Continued Pre-training for Low-Resource Automatic Speech Recognition},
  author = {Ashish Seth and Sreyan Ghosh and S. Umesh and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2312.12783},
  year   = {2023}
}

备注

Accepted to ICASSP 2024. Code: https://github.com/cs20s030/stable_distillation