一种使用 $\beta$-VAE 的深度表示学习语音增强方法
音频与语音处理
2022-05-12 v1 声音
摘要
在之前的工作中,我们提出了一种基于变分自编码器(VAE)的贝叶斯置换训练语音增强(SE)方法(PVAE),该方法表明传统基于深度神经网络(DNN)的方法的 SE 性能可通过深度表示学习(DRL)得到提升。基于我们之前的工作,本文提出使用 -VAE 来进一步提升 PVAE 的表示学习能力。更具体地,我们的 -VAE 能够改善 PVAE 从观测信号中解耦不同潜变量而不存在解耦与信号重建之间权衡问题的能力。该权衡问题广泛存在于以往的 -VAE 算法中。与以往的 -VAE 算法不同,所提出的 -VAE 策略还可用于优化 DNN 的结构。这意味着所提方法不仅能提升 PVAE 的 SE 性能,还能减少 PVAE 的训练参数量。实验结果表明,所提方法比 PVAE 能获得更好的语音与噪声潜表示。同时,它还取得了更高的尺度不变信号失真比、语音质量与语音可懂度。
引用
@article{arxiv.2205.05581,
title = {A deep representation learning speech enhancement method using $\beta$-VAE},
author = {Yang Xiang and Jesper Lisby Højvang and Morten Højfeldt Rasmussen and Mads Græsbøll Christensen},
journal= {arXiv preprint arXiv:2205.05581},
year = {2022}
}
备注
Submitted to Eurosipco