基于神经音频编解码器连续嵌入的语音增强
音频与语音处理
2025-03-18 v1 人工智能
机器学习
声音
摘要
近期神经音频编解码器(NAC)模型的进展激发了其在语音处理任务中的应用,包括语音增强(SE)。本文提出一种新颖且高效的方法,利用预训练NAC编码器的预量化输出进行SE。不同于先前基于NAC的SE方法使用语言模型(LM)处理离散语音标记,我们在NAC的连续嵌入空间中进行SE,该空间在时间维度上高度压缩,具有高效表征。我们的轻量级SE模型通过嵌入级损失优化,实验结果表明其在较小数据集上训练的基线模型性能相当,实时因子仅为0.005。此外,我们的方法GMAC低至3.94,在模拟云端音频传输环境下将复杂度降低18倍。本工作揭示了一种新的高效NAC基SE方案,特别适合云端应用,其中NAC用于压缩音频后传输。
引用
@article{arxiv.2502.16240,
title = {Speech Enhancement Using Continuous Embeddings of Neural Audio Codec},
author = {Haoyang Li and Jia Qi Yip and Tianyu Fan and Eng Siong Chng},
journal= {arXiv preprint arXiv:2502.16240},
year = {2025}
}
备注
Accepted to ICASSP 2025