学习时间-图频率表示用于单声道语音增强
音频与语音处理
2025-10-03 v2
摘要
图傅里叶变换(GFT)最近在语音增强方面显示出良好的潜力。然而,现有的基于GFT的语音增强方法常采用固定的图拓扑结构构建图傅里叶基,导致其表示缺乏自适应性和灵活性。此外,这些方法受基于奇异值分解(GFT-SVD)和特征向量分解(GFT-EVD)的矩阵求逆所引入的数值误差和不稳定性。针对这些局限性,本文提出一种简单而有效的可学习GFT-SVD框架用于语音增强。具体而言,我们利用图移位算子构建可学习的图拓扑,并通过1-D卷积(Conv-1D)神经层使用奇异值矩阵定义可学习的图傅里叶基,消除矩阵求逆的需求,从而避免相关的数值误差和稳定性问题。
引用
@article{arxiv.2510.01130,
title = {Learning Time-Graph Frequency Representation for Monaural Speech Enhancement},
author = {Tingting Wang and Tianrui Wang and Meng Ge and Qiquan Zhang and Xi Shao},
journal= {arXiv preprint arXiv:2510.01130},
year = {2025}
}
备注
Accepted by IEEE TASLP