中文

基于变分自编码器与对抗训练的两阶段深度表示学习语音增强方法

音频与语音处理 2023-09-28 v2 声音

摘要

本文致力于利用深度表示学习(DRL)进行语音增强(SE)。一般而言,深度神经网络(DNN)的性能高度依赖于数据表示的学习,然而在许多基于 DNN 的 SE 算法中,DRL 的重要性常被忽视。为获得更高质量的增强语音,我们提出了一种通过对抗训练实现的两阶段基于 DRL 的 SE 方法。在第一阶段,我们对不同潜变量进行解耦,因为解耦表示有助于 DNN 生成更好的增强语音。具体而言,我们使用 β\beta-变分自编码器(VAE)算法从观测信号中获取语音与噪声的后验估计及相关表示。然而,由于后验与表示难以处理,且我们只能施加条件假设来估计它们,难以保证这些估计始终足够准确,这可能潜在地降低信号估计的最终精度。为进一步提升增强语音质量,在第二阶段我们引入对抗训练,以减轻不准确后验对信号重构的影响并提高信号估计精度,使我们的算法对潜在不准确的后验估计更具鲁棒性。由此可获得更好的 SE 性能。实验结果表明,所提策略可帮助同类基于 DNN 的 SE 算法取得更高的短时客观可懂度(STOI)、语音质量感知评估(PESQ)和尺度不变信失真比(SI-SDR)分数。此外,所提算法亦能优于近期具有竞争力的 SE 算法。

关键词

引用

@article{arxiv.2211.09166,
  title  = {A Two-Stage Deep Representation Learning-Based Speech Enhancement Method Using Variational Autoencoder and Adversarial Training},
  author = {Yang Xiang and Jesper Lisby Højvang and Morten Højfeldt Rasmussen and Mads Græsbøll Christensen},
  journal= {arXiv preprint arXiv:2211.09166},
  year   = {2023}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing