中文

TSTNN:基于两阶段Transformer的时域语音增强神经网络

音频与语音处理 2021-03-19 v1 机器学习 声音 信号处理

摘要

本文提出一种基于Transformer的架构,称为两阶段Transformer神经网络(TSTNN),用于时域端到端语音去噪。所提模型由编码器、两阶段Transformer模块(TSTM)、掩码模块和解码器组成。编码器将输入含噪语音映射为特征表示。TSTM利用四个堆叠的两阶段Transformer块,从编码器输出中逐阶段高效地提取局部与全局信息。掩码模块生成掩码并与编码器输出相乘。最后,解码器利用掩码后的编码器特征重建增强语音。在基准数据集上的实验结果表明,TSTNN在时域或频域均优于大多数最先进模型,同时具有显著更低的模型复杂度。

关键词

引用

@article{arxiv.2103.09963,
  title  = {TSTNN: Two-stage Transformer based Neural Network for Speech Enhancement in the Time Domain},
  author = {Kai Wang and Bengbeng He and Wei-Ping Zhu},
  journal= {arXiv preprint arXiv:2103.09963},
  year   = {2021}
}

备注

5 pages, 4 figures, accepted by IEEE ICASSP 2021