中文

使用自监督预训练模型与矢量量化的语音增强

音频与语音处理 2022-09-29 v1 声音

摘要

随着深度学习的发展,基于神经网络的语音增强(SE)模型已展现出优异性能。同时,研究表明自监督预训练模型的发展可应用于各类下游任务。本文将考虑预训练模型在实时 SE 问题上的应用。具体而言,使用自监督预训练的 WavLM 模型初始化 DEMUCS 模型的编码器与瓶颈层,将编码器中的卷积替换为因果卷积,且瓶颈层中的 transformer 编码器基于因果注意力掩码。此外,由于对带噪语音表示进行离散化更利于去噪,我们利用量化模块将瓶颈层输出的表示离散化,随后将其送入解码器以重建干净语音波形。在 Valentini 数据集与一内部数据集上的实验结果表明,基于预训练模型的初始化可提升 SE 性能,且离散化操作在一定程度上抑制了表示中的噪声成分,从而进一步提升性能。

关键词

引用

@article{arxiv.2209.14150,
  title  = {Speech Enhancement Using Self-Supervised Pre-Trained Model and Vector Quantization},
  author = {Xiao-Ying Zhao and Qiu-Shi Zhu and Jie Zhang},
  journal= {arXiv preprint arXiv:2209.14150},
  year   = {2022}
}

备注

Accepted to APSIPA ASC 2022