自监督语音模型的集成知识蒸馏
音频与语音处理
2023-02-27 v1 计算与语言
声音
摘要
蒸馏的自监督模型近年来展现出具有竞争力的性能与效率。然而,关于联合蒸馏多个自监督语音模型的经验尚显不足。在我们的工作中,我们对多种自监督语音模型(如 HuBERT、RobustHuBERT 与 WavLM)进行了集成知识蒸馏(EKD)。我们尝试了两种不同的聚合技术——逐层平均与逐层拼接——作用于不同教师模型的表示,发现前者更为有效。在此基础上,我们提出一种多预测头方法,使学生模型同时预测多个教师模型的不同层输出。实验结果表明,我们的方法在 SUPERB 基准的隐藏集赛道上的四个下游语音处理任务(音素识别、说话人识别、情感识别与自动语音识别)上提升了蒸馏模型的性能。
引用
@article{arxiv.2302.12757,
title = {Ensemble knowledge distillation of self-supervised speech models},
author = {Kuan-Po Huang and Tzu-hsun Feng and Yu-Kuan Fu and Tsu-Yuan Hsu and Po-Chieh Yen and Wei-Cheng Tseng and Kai-Wei Chang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2302.12757},
year = {2023}
}
备注
Accepted by ICASSP 2023