基于变分自编码器与对抗训练的两阶段深度表示学习语音增强方法
音频与语音处理
2023-09-28 v2 声音
摘要
本文致力于利用深度表示学习(DRL)进行语音增强(SE)。一般而言,深度神经网络(DNN)的性能高度依赖于数据表示的学习,然而在许多基于 DNN 的 SE 算法中,DRL 的重要性常被忽视。为获得更高质量的增强语音,我们提出了一种通过对抗训练实现的两阶段基于 DRL 的 SE 方法。在第一阶段,我们对不同潜变量进行解耦,因为解耦表示有助于 DNN 生成更好的增强语音。具体而言,我们使用 -变分自编码器(VAE)算法从观测信号中获取语音与噪声的后验估计及相关表示。然而,由于后验与表示难以处理,且我们只能施加条件假设来估计它们,难以保证这些估计始终足够准确,这可能潜在地降低信号估计的最终精度。为进一步提升增强语音质量,在第二阶段我们引入对抗训练,以减轻不准确后验对信号重构的影响并提高信号估计精度,使我们的算法对潜在不准确的后验估计更具鲁棒性。由此可获得更好的 SE 性能。实验结果表明,所提策略可帮助同类基于 DNN 的 SE 算法取得更高的短时客观可懂度(STOI)、语音质量感知评估(PESQ)和尺度不变信失真比(SI-SDR)分数。此外,所提算法亦能优于近期具有竞争力的 SE 算法。
引用
@article{arxiv.2211.09166,
title = {A Two-Stage Deep Representation Learning-Based Speech Enhancement Method Using Variational Autoencoder and Adversarial Training},
author = {Yang Xiang and Jesper Lisby Højvang and Morten Højfeldt Rasmussen and Mads Græsbøll Christensen},
journal= {arXiv preprint arXiv:2211.09166},
year = {2023}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing