用于单通道语音增强的深度神经网络技术:现状分析
声音
2023-06-21 v2 机器学习
音频与语音处理
摘要
深度神经网络(DNN)技术已在自然语言处理与计算机视觉等领域变得无处不在。它们在这些领域的机器翻译与图像生成等任务中取得了巨大成功。由于其成功,这些 data driven 技术已被应用于音频领域。更具体地,DNN模型已被应用于语音增强领域,以在单通道语音增强中实现去噪、去混响与多说话人分离。在本文中,我们回顾一些被用于实现语音分离的主导DNN技术。该综述考察语音增强的完整流程,从特征提取、基于DNN的工具如何建模语音的全局与局部特征,到模型训练(监督与无监督)。我们还回顾语音增强预训练模型的使用以助推语音增强过程。该综述致力于涵盖关于DNN在单说话人语音中应用的语音增强方面的主导趋势。
引用
@article{arxiv.2212.00369,
title = {Deep neural network techniques for monaural speech enhancement: state of the art analysis},
author = {Peter Ochieng},
journal= {arXiv preprint arXiv:2212.00369},
year = {2023}
}
备注
conference