中文

基于频带分割 RNN 的高保真语音增强

音频与语音处理 2023-06-07 v2

摘要

尽管语音增强(SE)研究进展迅速,但在强噪声和干扰说话人环境下增强目标语音质量仍然具有挑战性。在本文中,我们将最近提出的频带分割 RNN(BSRNN)模型扩展到全带 SE 和个性化 SE(PSE)任务。为减轻全带语音中高频分量不稳定的影响,我们分别对低频和高频子带进行双向和单向的频带级建模。对于 PSE 任务,我们将说话人注册模块整合进 BSRNN 以利用目标说话人信息。此外,我们利用 MetricGAN 判别器(MGD)和多分辨率谱图判别器(MRSD)来提升感知质量指标。实验结果表明,我们的系统优于多种排名靠前的 SE 系统,在 DNS-2020 测试集上取得了最先进(SOTA)结果,并在 DNS-2023 挑战赛中排名前三。

关键词

引用

@article{arxiv.2212.00406,
  title  = {High Fidelity Speech Enhancement with Band-split RNN},
  author = {Jianwei Yu and Yi Luo and Hangting Chen and Rongzhi Gu and Chao Weng},
  journal= {arXiv preprint arXiv:2212.00406},
  year   = {2023}
}