基于复值 LSTM 实现的相位感知语音增强
音频与语音处理
2020-10-28 v1 人工智能
信号处理
摘要
大多数基于深度学习的语音增强(SE)方法依赖于从观察到的含噪语音信号估计干净语音信号的幅度谱,或通过幅度谱掩蔽或通过回归。这些方法在从估计幅度谱合成时域波形时复用含噪相位。然而,近期已有工作强调了相位在 SE 中的重要性。曾有尝试使用复值前馈神经网络(FFNN)考虑相位来估计复比值掩蔽。但 FFNN 无法捕获对相位估计至关重要的时序信息。本工作中,我们提出一种复值长短期记忆(RCLSTM)网络的实现,以利用沿时间的时序信息估计复比值掩蔽(CRM)。所提出的 RCLSTM 设计用于使用复数运算处理复值序列,因此保留了 CRM 的实部与虚部之间以及进而相位的依赖关系。所提方法在由 Voice-Bank 语料库和 DEMAND 数据库构成的含噪语音混合上进行了评估。与基于实值掩蔽的方法相比,所提出的 RCLSTM 在包括语音质量感知评估(PESQ)在内的若干客观度量上优于它们,其中 PESQ 提升超过 4.3%。
引用
@article{arxiv.2010.14122,
title = {Phase Aware Speech Enhancement using Realisation of Complex-valued LSTM},
author = {Raktim Gautam Goswami and Sivaganesh Andhavarapu and K Sri Rama Murty},
journal= {arXiv preprint arXiv:2010.14122},
year = {2020}
}