中文

LL-SDR:基于离散表示的低延迟语音增强

声音 2026-03-24 v1 音频与语音处理

摘要

许多语音增强(SE)方法依赖连续表示。最近探索了离散音频标记以实现SE的自回归生成,但离子化本身是否一致提高SE性能仍不清楚。本文引入LL-SDR,一个基于标记的语音增强框架,显式利用离子化以更好地分离语音和噪声分布。我们的第一个贡献是方差排序残差向量量化器(VO-RVQ),旨在在标记化过程中解耦语音和噪声分布。其次,我们提出了一个潜在空间判别器以更好地对齐增强嵌入与语义嵌入。实验表明,LL-SDR优于连续基线方法,同时与自回归标记方法的性能相当,实现了在室内和非室内噪声环境中轻量级、低延迟语音增强。演示和源代码均可在我们的项目网站上获取。

关键词

引用

@article{arxiv.2603.20242,
  title  = {LL-SDR: Low-Latency Speech enhancement through Discrete Representations},
  author = {Jingyi Li and Luca Della Libera and Mirco Ravanelli and Cem Subakan},
  journal= {arXiv preprint arXiv:2603.20242},
  year   = {2026}
}

备注

5 pages, 1 figure