中文

基于深度复数 U 型网络与概率潜空间模型的单通道语音增强

音频与语音处理 2023-09-06 v1 声音

摘要

本文提出通过引入概率(即变分)潜空间模型来扩展用于语音增强的深度复数 U 型网络(deep complex U-Network)架构。所提模型与自身的若干消减版本进行了评估,以研究变分潜空间模型、复值处理与自注意力的影响。在 MS-DNS 2020 与 Voicebank+Demand 数据集上的评估取得了一致的高性能。例如,所提模型实现高达 20.2 dB 的 SI-SDR,比无概率潜空间的消减版本高约 0.5 至 1.4 dB,比 WaveUNet 高 2-2.4 dB,比 PHASEN 高 6.7 dB。与采用变分 U-Net 的实值幅度谱处理相比,复数 U-Net 实现了高达 4.5 dB SI-SDR 的提升。在无混响条件下,将复谱编码为幅度与相位取得最佳性能;而实部与虚部表示在对(新颖)混响条件上泛化更好,可能源于声学底层物理。

关键词

引用

@article{arxiv.2309.01535,
  title  = {Single-Channel Speech Enhancement with Deep Complex U-Networks and Probabilistic Latent Space Models},
  author = {Eike J. Nustede and Jörn Anemüller},
  journal= {arXiv preprint arXiv:2309.01535},
  year   = {2023}
}