用于时域语音增强的带自注意力的密集 CNN
音频与语音处理
2021-03-09 v2 声音
摘要
近年来,时域语音增强日益流行,因其能够联合增强语音的幅度和相位。在本工作中,我们提出一种带自注意力的密集卷积网络 (DCN) 用于时域语音增强。DCN 是一种基于编码器与解码器、带跳跃连接的架构。编码器与解码器中的每一层包含一个密集块和一个注意力模块。密集块与注意力模块借助特征复用、网络深度增加与最大上下文聚合的组合来辅助特征提取。此外,我们揭示了基于增强语音谱幅度损失的先前未知问题。为缓解这些问题,我们提出一种基于增强语音与预测噪声幅度的新损失。尽管所提损失仅基于幅度,但噪声预测施加的约束确保该损失同时增强幅度与相位。实验结果表明,采用所提损失训练的 DCN 在因果与非因果语音增强上均大幅优于其他 SOTA 方法。
引用
@article{arxiv.2009.01941,
title = {Dense CNN with Self-Attention for Time-Domain Speech Enhancement},
author = {Ashutosh Pandey and DeLiang Wang},
journal= {arXiv preprint arXiv:2009.01941},
year = {2021}
}
备注
submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing