采用师生学习的超快语音分离模型
音频与语音处理
2022-04-28 v1 计算与语言
声音
摘要
Transformer近来凭借其利用自注意力机制的强大长程依赖建模能力,被成功应用于语音分离。然而,Transformer因编码器层数深,往往运行时成本高昂,阻碍了其在边缘设备上的部署。一个编码器层数较少的小型Transformer模型在计算效率上更受青睐,但容易性能下降。本文提出一种超快语音分离Transformer模型,通过师生学习(T-S学习)同时实现更优的性能和效率。我们引入逐层T-S学习和目标偏移机制,引导小型学生模型从大型教师模型学习中间表示。与从头训练的小型Transformer模型相比,所提出的T-S学习方法在LibriCSS数据集上,对于多通道和单通道语音分离,均将词错误率(WER)降低了超过5%。利用更多无标签语音数据,我们的超快语音分离模型取得了超过10%的相对WER降低。
引用
@article{arxiv.2204.12777,
title = {Ultra Fast Speech Separation Model with Teacher Student Learning},
author = {Sanyuan Chen and Yu Wu and Zhuo Chen and Jian Wu and Takuya Yoshioka and Shujie Liu and Jinyu Li and Xiangzhan Yu},
journal= {arXiv preprint arXiv:2204.12777},
year = {2022}
}
备注
Accepted by interspeech 2021