中文

ParaGSE:基于基于群向量量化的神经语音编解码器的并行生成式语音增强

声音 2026-02-03 v1

摘要

最近,生成式语音增强受到了广泛关注;然而,现有方法受限于计算复杂度高、效率有限以及语音质量次优。为此,本文提出了一种新型并行生成式语音增强(ParaGSE)框架,利用基于群向量量化(GVQ)的神经语音编解码器。GVQ 基于编解码器采用独立的 VQ 来产生互不相关的 token,从而实现 ParaGSE 中高效的并行 token 预测。具体而言,ParaGSE 利用 GVQ 基于编解码器将退化语音编码为离散 token,通过在退化谱特征条件下的平行分支预测对应的干净 token,最终通过编解码器解码器重建干净语音。实验结果表明,ParaGSE 在包括噪声、混响、带宽限制及其混合等多种失真条件下, consistently 能产生优于判别式和生成式基线的优质增强语音。此外,凭借 token 预测中的并行计算能力,ParaGSE 在 CPU 上的生成效率相较于串行生成式语音增强方法提升约 1.5 倍。

关键词

引用

@article{arxiv.2602.01793,
  title  = {ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-based Neural Speech Codec},
  author = {Fei Liu and Yang Ai},
  journal= {arXiv preprint arXiv:2602.01793},
  year   = {2026}
}

备注

Accepted by ICASSP 2026