中文

改进输入条件不变语音增强的设计

音频与语音处理 2024-02-19 v2 声音

摘要

构建一个能处理任意输入的单一通用语音增强(SE)系统是一个需求迫切但探索不足的研究课题。为了实现这一最终目标,一个方向是构建一个单一模型,能够在嘈杂和混响场景中处理多样的音频时长、采样频率和麦克风变化,我们在此将其定义为“输入条件不变语音增强”。最近提出的一种此类模型显示出有前景的性能;然而,其多通道性能在实际条件下严重下降。在本文中,我们提出了新颖的架构来改进输入条件不变语音增强模型,使其在模拟条件下的性能保持竞争力,同时大大减轻实际条件下的性能下降。为此,我们重新设计了构成此类系统的关键组件。首先,我们识别出通道建模模块对未见场景的泛化能力可能并非最优,并重新设计了这个模块。我们进一步引入了一种两阶段训练策略以提高训练效率。其次,我们提出了两种新颖的双路径时频块,与现有方法相比,它们以更少的参数和计算成本展示了卓越的性能。综合所有提议,在多个公共数据集上的实验验证了所提模型的有效性,在实际条件下性能显著提升。包含完整模型细节的方案已在 https://github.com/espnet/espnet 发布。

关键词

引用

@article{arxiv.2401.14271,
  title  = {Improving Design of Input Condition Invariant Speech Enhancement},
  author = {Wangyou Zhang and Jee-weon Jung and Shinji Watanabe and Yanmin Qian},
  journal= {arXiv preprint arXiv:2401.14271},
  year   = {2024}
}

备注

Accepted by ICASSP 2024, 5 pages, 2 figures, 3 tables (corrected the results of no processing on CHiME-4 (Simu) in Table 2)