中文

基于离散音频 token 的高保真语音增强

声音 2025-10-03 v1 机器学习 音频与语音处理

摘要

近期基于自回归 Transformer 的语音增强(SE)方法通过利用先进的语义理解和语音上下文建模,展现出了极具前景的结果。然而,这些方法通常依赖于复杂的多阶段流水线和低采样率编解码器,使其局限于狭窄且特定任务的语音增强。在本工作中,我们引入了 DAC-SE1,这是一个简化的基于语言模型的 SE 框架,利用离散高分辨率音频表示;DAC-SE1 在保持语义连贯性的同时保留了细粒度的声学细节。我们的实验表明,DAC-SE1 在客观感知指标和 MUSHRA 人类评估上均超越了最先进的自回归 SE 方法。我们发布了代码库和模型检查点,以支持在可扩展、统一和高质量语音增强方面的进一步研究。

关键词

引用

@article{arxiv.2510.02187,
  title  = {High-Fidelity Speech Enhancement via Discrete Audio Tokens},
  author = {Luca A. Lanzendörfer and Frédéric Berdoz and Antonis Asonitis and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2510.02187},
  year   = {2025}
}