中文

Taylor,现在能听到我吗?一种用于单通道语音增强的泰勒展开框架

声音 2022-05-03 v1 音频与语音处理

摘要

尽管深度学习技术推动了语音增强(SE)领域的快速发展,大多数方案仅以黑盒方式追求性能,缺乏充分的模型可解释性。受泰勒逼近理论启发,我们提出了一种可解释的解耦式SE框架,将复谱恢复解耦为两个独立的优化问题,即幅度和复残差估计。具体而言,作为泰勒级数的0阶项,精心设计一个滤波网络仅在幅度域抑制噪声分量并获得粗谱。为细化相位分布,我们估计稀疏复残差,其定义为目标谱与粗谱之差并度量相位间隙。在本研究中,我们将残差分量表述为各种高阶泰勒项的组合,并提出一个轻量可训练模块以替代相邻项间复杂的导数算子。最后,遵循泰勒公式,我们通过0阶项与高阶项的叠加重建目标谱。在两个基准数据集上的实验结果表明,我们的框架在各种评价指标上取得了优于以往竞争基线的state-of-the-art性能。源代码可在 github.com/Andong-Lispeech/TaylorSENet 获取。

关键词

引用

@article{arxiv.2205.00206,
  title  = {Taylor, Can You Hear Me Now? A Taylor-Unfolding Framework for Monaural Speech Enhancement},
  author = {Andong Li and Shan You and Guochen Yu and Chengshi Zheng and Xiaodong Li},
  journal= {arXiv preprint arXiv:2205.00206},
  year   = {2022}
}

备注

Accepted by IJCAI2022, Long Oral