利用频谱注意力融合的高效单通道语音增强
声音
2023-08-07 v1 计算与语言
音频与语音处理
摘要
语音增强是自动化语音处理流程中的一项高需求任务,侧重于从噪声信道中分离干净语音。基于Transformer的模型近来在语音增强上超越了RNN与CNN模型,但与此同时它们计算开销大得多且需要多得多的优质训练数据,而这类数据往往难以获取。在本文中,我们提出了一种语音增强模型的改进,在保持自注意力表达力的同时显著降低模型复杂度,我们称之为频谱注意力融合(Spectrum Attention Fusion)。我们精心构建了一个卷积模块以替换语音Transformer中的若干自注意力层,使模型能更高效地融合频谱特征。我们提出的模型在Voice Bank + DEMAND数据集上以显著更小的参数量(0.58M)取得了与SOTA模型相当或更好的结果。
引用
@article{arxiv.2308.02263,
title = {Efficient Monaural Speech Enhancement using Spectrum Attention Fusion},
author = {Jinyu Long and Jetic Gū and Binhao Bai and Zhibo Yang and Ping Wei and Junli Li},
journal= {arXiv preprint arXiv:2308.02263},
year = {2023}
}