中文

受泰勒定理启发的通用展开式语音增强方法

声音 2023-03-29 v2 音频与语音处理

摘要

尽管深度神经网络已推动语音增强领域的显著进展,大多数现有方法的开发遵循经验或相对盲目的准则,在流程设计上缺乏充分指导。受泰勒定理启发,我们提出一种面向单通道与多通道语音增强任务的通用展开框架。具体而言,我们将复谱恢复公式化为噪声混合邻域空间中的谱幅度映射,其中引入未知稀疏项并预先用于相位修正。基于此,映射函数被分解为泰勒级数中零阶与高阶多项式的叠加:前者粗略去除幅度域中的干扰,后者逐步补充复谱域中剩余的频谱细节。此外,我们研究了相邻阶项间的关系,揭示每个高阶项可由其低阶项递归估计,并进而提出使用带可训练权重的代理函数评估各高阶项,使整个系统能以端到端方式训练。鉴于所提框架基于泰勒定理设计,其具备改进的内在灵活性。我们在 WSJ0-SI84、DNS-Challenge、Voicebank+Demand、空间化 Librispeech 及 L3DAS22 多通道语音增强挑战数据集上进行了大量实验。定量结果表明,所提方法在多项客观指标上优于现有顶尖方法。

关键词

引用

@article{arxiv.2211.16764,
  title  = {A General Unfolding Speech Enhancement Method Motivated by Taylor's Theorem},
  author = {Andong Li and Guochen Yu and Chengshi Zheng and Wenzhe Liu and Xiaodong Li},
  journal= {arXiv preprint arXiv:2211.16764},
  year   = {2023}
}

备注

Submitted to TASLP, revised version, 17 pages