VSANet:基于语音活动检测与因果空间注意力的实时语音增强
音频与语音处理
2023-11-02 v2
摘要
基于深度学习的语音增强(SE)方法通常以干净语音的波形或时频谱特征作为学习目标,并通过减小深度神经网络(DNN)输出与目标之间的误差损失来训练 DNN。这是一种传统的单任务学习范式,已被证明有效,但我们发现多任务学习框架能够提升 SE 性能。具体而言,我们设计了一个包含 SE 模块和语音活动检测(VAD)模块的框架,二者共享同一编码器,整个网络由两个模块的加权损失进行优化。此外,我们设计了一种因果空间注意力(CSA)块以增强 DNN 的表示能力。结合 VAD 辅助的多任务学习框架与 CSA 块,我们的 SE 网络被命名为 VSANet。实验结果证明了多任务学习及 CSA 块的优势,使 VSANet 获得了优异的 SE 性能。
引用
@article{arxiv.2310.07295,
title = {VSANet: Real-time Speech Enhancement Based on Voice Activity Detection and Causal Spatial Attention},
author = {Yuewei Zhang and Huanbin Zou and Jie Zhu},
journal= {arXiv preprint arXiv:2310.07295},
year = {2023}
}
备注
Accepted by ASRU 2023