中文

修复性语音增强:基于SE和编解码器模块的渐进方法

音频与语音处理 2024-10-03 v1 声音

摘要

在噪声和混响显著的困难环境中,传统语音增强(SE)方法常导致语音过度抑制,产生伴随听觉和下游任务性能损失的伪影。为克服这些限制,我们提出一种新方法,称为修复性语音增强(RestSE),其结合了轻量级SE模块和生成式编解码器模块,以渐进方式增强和恢复语音质量。SE模块初始减少噪声,而编解码器模块随后执行去混响并恢复语音。我们系统地探索了编解码器模块中的各种量化技术以优化性能。此外,我们引入加权损失函数和特征融合,将SE输出与原始混合信号合并,尤其在SE输出受严重失真的片段处。实验结果显示,我们提出的方法在恶劣条件下有效提升了语音质量。音频演示可在:https://sophie091524.github.io/RestorativeSE/ 查看。

关键词

引用

@article{arxiv.2410.01150,
  title  = {Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules},
  author = {Hsin-Tien Chiang and Hao Zhang and Yong Xu and Meng Yu and Dong Yu},
  journal= {arXiv preprint arXiv:2410.01150},
  year   = {2024}
}

备注

Paper in submission