修复性语音增强:基于SE和编解码器模块的渐进方法
音频与语音处理
2024-10-03 v1 声音
摘要
在噪声和混响显著的困难环境中,传统语音增强(SE)方法常导致语音过度抑制,产生伴随听觉和下游任务性能损失的伪影。为克服这些限制,我们提出一种新方法,称为修复性语音增强(RestSE),其结合了轻量级SE模块和生成式编解码器模块,以渐进方式增强和恢复语音质量。SE模块初始减少噪声,而编解码器模块随后执行去混响并恢复语音。我们系统地探索了编解码器模块中的各种量化技术以优化性能。此外,我们引入加权损失函数和特征融合,将SE输出与原始混合信号合并,尤其在SE输出受严重失真的片段处。实验结果显示,我们提出的方法在恶劣条件下有效提升了语音质量。音频演示可在:https://sophie091524.github.io/RestorativeSE/ 查看。
引用
@article{arxiv.2410.01150,
title = {Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules},
author = {Hsin-Tien Chiang and Hao Zhang and Yong Xu and Meng Yu and Dong Yu},
journal= {arXiv preprint arXiv:2410.01150},
year = {2024}
}
备注
Paper in submission