中文

并肩优化:一种用于实时全频带语音增强的协调子带融合模型

声音 2022-06-16 v2 音频与语音处理

摘要

由于对更多频带建模的计算复杂度较高,基于深度神经网络进行实时全频带语音增强仍然难以实现。近期研究通常利用压缩的感知驱动特征以较低频率分辨率通过单阶段网络滤波全频带频谱,导致语音质量提升有限。本文提出一种用于全频带语音增强的协调子带融合网络,旨在以逐步方式恢复低频带(0-8 kHz)、中频带(8-16 kHz)和高频带(16-24 kHz)。具体而言,首先预训练双流网络以恢复低频带复频谱,并设计另外两个子网络作为仅幅度域中的中频带和高频带噪声抑制器。为充分利用信息互通,我们采用子带交互模块在不同频带间提供外部知识引导。大量实验表明,所提方法相对于最先进的(SOTA)全频带基线具有一致的性能优势。

关键词

引用

@article{arxiv.2203.16033,
  title  = {Optimizing Shoulder to Shoulder: A Coordinated Sub-Band Fusion Model for Real-Time Full-Band Speech Enhancement},
  author = {Guochen Yu and Andong Li and Wenzhe Liu and Chengshi Zheng and Yutian Wang and Hui Wang},
  journal= {arXiv preprint arXiv:2203.16033},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2203.00472