DistilXLSR:一种轻量级跨语言语音表征模型
计算与语言
2023-06-05 v1 声音
音频与语音处理
摘要
多语言自监督语音表征模型极大提升了低资源语言的语音识别性能,而这些庞大模型的压缩也成为其工业应用的关键前提。本文提出 DistilXLSR,一种蒸馏的跨语言语音表征模型。通过对现有语音的音素随机打乱,我们降低了语言信息,并仅使用英语数据蒸馏跨语言模型。我们还设计了一种层跳跃初始化方法以充分利用教师的预训练权重。在 2 种教师模型和 15 种低资源语言上的实验表明,我们的方法能在保持跨语言表征能力的同时将参数量减少 50%。我们的方法被证明可泛化至各种语言/教师模型,并有望提升英语预训练模型的跨语言性能。
引用
@article{arxiv.2306.01303,
title = {DistilXLSR: A Light Weight Cross-Lingual Speech Representation Model},
author = {Haoyu Wang and Siyuan Wang and Wei-Qiang Zhang and Jinfeng Bai},
journal= {arXiv preprint arXiv:2306.01303},
year = {2023}
}
备注
Accepted by INTERSPEECH 2023