中文

TFCN:用于单通道语音增强的时频卷积网络

音频与语音处理 2022-01-04 v1

摘要

基于深度学习的单通道语音增强试图训练一个神经网络模型以预测干净语音信号。单通道语音增强有诸多流行的网络结构,如 TCNN、UNet、WaveNet 等。然而,这些结构通常包含数百万参数,这对移动应用而言是一大障碍。在本工作中,我们提出了一种名为 TFCN 的轻量级语音增强神经网络。它是一个由膨胀卷积和深度可分离卷积构建的时频卷积网络。我们从短时客观可懂度(STOI)、语音质量感知评估(PESQ)以及一系列名为 Csig、Cbak 和 Covl 的复合指标方面评估 TFCN 的性能。实验结果表明,与 TCN 及其他几种最先进(state-of-the-art)算法相比,所提出的结构仅用 93,000 个参数便取得了相当的性能。通过引入密集连接以及用普通卷积替换深度可分离卷积,可以以更多参数为代价实现进一步提升。实验还表明,所提出的结构在因果与非因果情形下均能良好工作。

关键词

引用

@article{arxiv.2201.00480,
  title  = {TFCN: Temporal-Frequential Convolutional Network for Single-Channel Speech Enhancement},
  author = {Xupeng Jia and Dongmei Li},
  journal= {arXiv preprint arXiv:2201.00480},
  year   = {2022}
}

备注

5 pages, 3 figures