中文

基于奇异值分解的时间图频率表示用于神经语音增强

音频与语音处理 2024-12-25 v2

摘要

时频(T-F)域方法对于单声道语音增强受益于深度学习的成功。最近,关注点放在设计双流网络模型来分别预测�幅掩码和相位,或将�幅和相位耦合到笛卡尔坐标中并构建实数和虚数配对。然而,大多数方法都受到双流网络框架下�幅和相位(实数和虚数配对)对齐建模的限制。本文引入一种基于奇异值分解(SVD)定义的图形傅里叶变换(GFT-SVD), resulting in real-valued time-graph representation for neural speech enhancement。这种基于实数时间图表示的GFT-SVD提供了对�幅和相位对齐建模的能力,从而避免恢复目标语音相位信息。我们的发现表明,基于GFT-SVD的实数时间图表示对于中性语音增强具有影响。广泛的语音增强实验表明,GFT-SVD与DNN的组合优于GFT与特征向量分解(GFT-EVD)和幅度估计 UNet 的组合,也优于短时傅里叶变换(STFT)和 DNN, 在客观 intelligibility 和感知质量方面。我们在 https://github.com/Wangfighting0015/GFT_project 上发布了源代码。

关键词

引用

@article{arxiv.2412.16823,
  title  = {Time-Graph Frequency Representation with Singular Value Decomposition for Neural Speech Enhancement},
  author = {Tingting Wang and Tianrui Wang and Meng Ge and Qiquan Zhang and Zirui Ge and Zhen Yang},
  journal= {arXiv preprint arXiv:2412.16823},
  year   = {2024}
}

备注

5 pages, 4 figures, Accepted by ICASSP2025