中文

用于语音增强的子带知识蒸馏框架

音频与语音处理 2020-10-30 v2 计算与语言 声音

摘要

在单通道语音增强中,基于全频带频谱特征的方法已被广泛研究。然而,仅有少数方法关注非全频带频谱特征。本文探索了一种基于子带频谱映射的单通道语音增强知识蒸馏框架。具体而言,我们将全频带划分为多个子带,并为每个子带预训练一个精英级子带增强模型(教师模型)。这些教师模型专门用于处理各自的子带。接下来,在教师模型的指导下,我们训练一个适用于所有子带的通用子带增强模型(学生模型)。在不增加模型参数数量和计算复杂度的情况下,学生模型的性能得到了进一步提升。为了评估我们提出的方法,我们在开源数据集上进行了大量实验。最终实验结果表明,来自精英级教师模型的指导极大地提升了学生模型的性能,该模型在使用更少参数的情况下超越了全频带模型。

关键词

引用

@article{arxiv.2005.14435,
  title  = {Sub-Band Knowledge Distillation Framework for Speech Enhancement},
  author = {Xiang Hao and Shixue Wen and Xiangdong Su and Yun Liu and Guanglai Gao and Xiaofei Li},
  journal= {arXiv preprint arXiv:2005.14435},
  year   = {2020}
}

备注

Published in Interspeech 2020