通用离散域语音增强
声音
2025-12-12 v2
摘要
在实际场景中,语音信号不可避免地会受到各种类型干扰的污染,这使得语音增强(SE)成为鲁棒语音处理中的关键任务。然而,现有的大多数 SE 方法仅能处理有限范围的失真,如加性噪声、混响或带宽限制,而对多种失真同时存在情况下的 SE 研究仍十分有限。这一空白影响了 SE 方法在实际环境中的泛化能力和实用性。为填补这一空白,本文提出了一种新颖的通用离散域 SE 模型,称为 UDSE。与直接预测干净语音波形或连续特征的基于回归的 SE 模型不同,UDSE 将 SE 重新定义为一个离散域分类任务,转而预测由预训练神经语音编解码器的残差矢量量化器(RVQ)所量化的干净离散标记。具体而言,UDSE 首先从退化语音中提取全局特征。在这些全局特征的指导下,每个 VQ 的干净标记预测遵循 RVQ 的规则,即每个 VQ 的预测依赖于其前序 VQ 的预测结果。最后,来自所有 VQ 的预测干净标记被解码以重建干净语音波形。在训练过程中,UDSE 模型采用教师强制(teacher-forcing)策略,并以交叉熵损失进行优化。实验结果证实,所提出的 UDSE 模型能够有效增强受到各种常规和非传统失真(如加性噪声、混响、带宽限制、削波、相位失真和压缩失真)及其组合退化的语音。这些结果表明,相较于先进的基于回归的 SE 方法,UDSE 具有卓越的通用性和实用性。
引用
@article{arxiv.2510.09974,
title = {Universal Discrete-Domain Speech Enhancement},
author = {Fei Liu and Yang Ai and Ye-Xin Lu and Rui-Chen Zheng and Hui-Peng Du and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2510.09974},
year = {2025}
}