TSTNN:基于两阶段Transformer的时域语音增强神经网络
音频与语音处理
2021-03-19 v1 机器学习
声音
信号处理
摘要
本文提出一种基于Transformer的架构,称为两阶段Transformer神经网络(TSTNN),用于时域端到端语音去噪。所提模型由编码器、两阶段Transformer模块(TSTM)、掩码模块和解码器组成。编码器将输入含噪语音映射为特征表示。TSTM利用四个堆叠的两阶段Transformer块,从编码器输出中逐阶段高效地提取局部与全局信息。掩码模块生成掩码并与编码器输出相乘。最后,解码器利用掩码后的编码器特征重建增强语音。在基准数据集上的实验结果表明,TSTNN在时域或频域均优于大多数最先进模型,同时具有显著更低的模型复杂度。
引用
@article{arxiv.2103.09963,
title = {TSTNN: Two-stage Transformer based Neural Network for Speech Enhancement in the Time Domain},
author = {Kai Wang and Bengbeng He and Wei-Ping Zhu},
journal= {arXiv preprint arXiv:2103.09963},
year = {2021}
}
备注
5 pages, 4 figures, accepted by IEEE ICASSP 2021