多粒度矢量量化的语音增强
音频与语音处理
2023-02-17 v1 声音
摘要
随着深度学习的进步,基于神经网络的语音增强(SE)在过去十年中发展迅速。同时,自监督预训练模型和矢量量化(VQ)在许多语音相关任务上取得了优异性能,但在SE上的探索较少。正如我们之前的工作所示,利用VQ模块离散化带噪语音表示有利于语音去噪,因此在这项工作中,我们研究了在不同层使用不同数量码本的VQ的影响。不同的VQ模块确实能够提取多粒度语音特征。通过注意力机制,预训练模型提取的上下文特征与编码器提取的局部特征融合,从而保留全局和局部信息以重建增强语音。在Valentini数据集上的实验结果表明,所提出的模型可以改善SE性能,同时也揭示了选择预训练模型的影响。
引用
@article{arxiv.2302.08342,
title = {Speech Enhancement with Multi-granularity Vector Quantization},
author = {Xiao-Ying Zhao and Qiu-Shi Zhu and Jie Zhang},
journal= {arXiv preprint arXiv:2302.08342},
year = {2023}
}