中文

基于神经音频编解码器连续嵌入的语音增强

音频与语音处理 2025-03-18 v1 人工智能 机器学习 声音

摘要

近期神经音频编解码器(NAC)模型的进展激发了其在语音处理任务中的应用,包括语音增强(SE)。本文提出一种新颖且高效的方法,利用预训练NAC编码器的预量化输出进行SE。不同于先前基于NAC的SE方法使用语言模型(LM)处理离散语音标记,我们在NAC的连续嵌入空间中进行SE,该空间在时间维度上高度压缩,具有高效表征。我们的轻量级SE模型通过嵌入级损失优化,实验结果表明其在较小数据集上训练的基线模型性能相当,实时因子仅为0.005。此外,我们的方法GMAC低至3.94,在模拟云端音频传输环境下将复杂度降低18倍。本工作揭示了一种新的高效NAC基SE方案,特别适合云端应用,其中NAC用于压缩音频后传输。

关键词

引用

@article{arxiv.2502.16240,
  title  = {Speech Enhancement Using Continuous Embeddings of Neural Audio Codec},
  author = {Haoyang Li and Jia Qi Yip and Tianyu Fan and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2502.16240},
  year   = {2025}
}

备注

Accepted to ICASSP 2025