基于焦点掩码与噪声特征分离的神经语音编解码器噪声环境自适应
音频与语音处理
2026-07-05 v1
摘要
神经语音编解码器因其在低比特率下实现高质量重建而受到广泛关注。然而,真实世界中的噪声会严重降低其性能,并阻碍高质量干净语音的重建。为解决这一问题,我们提出了FocalSE,一种新颖的语音增强方法,该方法在神经语音编解码器的连续嵌入空间中执行特征去噪、噪声特征分离和噪声识别。具体而言,我们开发了基于焦点调制的压缩和解压缩,以捕获全局上下文和局部互信息,并生成焦点掩码以恢复干净的嵌入特征。然后,我们将噪声嵌入从含噪嵌入中分离出来,以提高去噪性能。最后,我们使用ResNet1D-18识别噪声类别,以获得更好的分离效果。在两个标准数据集LibriTTS和ESC50上进行的大量实验表明,在低比特率和低信噪比条件下,我们的方法优于最先进的方法。
引用
@article{arxiv.2607.04195,
title = {Noisy Environment Adaptation of Neural Speech Codec via Focal Mask and Noise Feature Separation},
author = {Shaokai Li and Weiping Tu and Yuhong Yang},
journal= {arXiv preprint arXiv:2607.04195},
year = {2026}
}
备注
Accepted for Interspeech 2026