RaD-Net 2:基于知识蒸馏和复杂轴向自注意力的因果双阶段修复与去噪语音增强网络
声音
2024-06-12 v1 音频与语音处理
摘要
在实时语音通信系统中,语音信号常常受到多种失真的影响。最近提出了一个两阶段修复与去噪网络(RaD-Net),在 ICASSP 2024 Speech Signal Improvement(SSI)挑战中表现出优异的语音质量。然而,未利用未来信息以及卷积层受限的感受野限制了系统性能。为缓解这些问题,我们将 RaD-Net 扩展为其升级版本 RaD-Net 2。具体而言,在第一阶段引入基于因果性的知识蒸馏,以一种因果的方式利用未来信息。我们使用非因果的修复网络作为教师网络,以提升因果修复网络的性能。此外,在第二阶段,应用复杂轴向自注意力机制于去噪网络的复杂特征编码器/解码器中。在 ICASSP 2024 SSI 挑战的盲测集上进行实验显示,RaD-Net 2 相较于 RaD-Net 实现了 0.10 的 OVRL DNSMOS 提升。
引用
@article{arxiv.2406.07498,
title = {RaD-Net 2: A causal two-stage repairing and denoising speech enhancement network with knowledge distillation and complex axial self-attention},
author = {Mingshuai Liu and Zhuangqi Chen and Xiaopeng Yan and Yuanjun Lv and Xianjun Xia and Chuanzeng Huang and Yijian Xiao and Lei Xie},
journal= {arXiv preprint arXiv:2406.07498},
year = {2024}
}
备注
Accepted by Interspeech 2024