中文

DistilXLSR:一种轻量级跨语言语音表征模型

计算与语言 2023-06-05 v1 声音 音频与语音处理

摘要

多语言自监督语音表征模型极大提升了低资源语言的语音识别性能,而这些庞大模型的压缩也成为其工业应用的关键前提。本文提出 DistilXLSR,一种蒸馏的跨语言语音表征模型。通过对现有语音的音素随机打乱,我们降低了语言信息,并仅使用英语数据蒸馏跨语言模型。我们还设计了一种层跳跃初始化方法以充分利用教师的预训练权重。在 2 种教师模型和 15 种低资源语言上的实验表明,我们的方法能在保持跨语言表征能力的同时将参数量减少 50%。我们的方法被证明可泛化至各种语言/教师模型,并有望提升英语预训练模型的跨语言性能。

关键词

引用

@article{arxiv.2306.01303,
  title  = {DistilXLSR: A Light Weight Cross-Lingual Speech Representation Model},
  author = {Haoyu Wang and Siyuan Wang and Wei-Qiang Zhang and Jinfeng Bai},
  journal= {arXiv preprint arXiv:2306.01303},
  year   = {2023}
}

备注

Accepted by INTERSPEECH 2023