中文

插件式语音增强:受动态神经网络启发的通用语音增强框架

音频与语音处理 2024-02-21 v1 声音

摘要

部署通用神经网络进行语音增强的期望旨在提高不同语音处理任务的噪声鲁棒性,但由于静态语音增强框架缺乏对下游模块预期语音的认知,这一期望面临挑战。这些局限性阻碍了静态语音增强方法在各种语音处理任务中实现最佳性能,从而挑战了其通用适用性的概念。实现通用语音增强的根本问题在于有效地告知语音增强模块关于下游模块的特征。在本研究中,我们提出了一种新颖的权重预测方法,该方法显式地从下游训练信息中学习任务关系,以解决通用语音增强的核心挑战。我们发现,决定是否采用数据增强技术作为关键的下游训练信息至关重要。这一决定显著影响预期语音和语音增强模块的性能。此外,我们引入了一种新颖的语音增强网络,即插件式语音增强(Plugin-SE)。Plugin-SE 是一种动态神经网络,包含语音增强模块、门控模块和权重预测模块。实验结果表明,所提出的 Plugin-SE 方法在各种下游任务中具有竞争力或优于其他联合训练方法。

关键词

引用

@article{arxiv.2402.12746,
  title  = {Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network},
  author = {Yanan Chen and Zihao Cui and Yingying Gao and Junlan Feng and Chao Deng and Shilei Zhang},
  journal= {arXiv preprint arXiv:2402.12746},
  year   = {2024}
}