中文

SenSE:语义感知的高保真通用语音增强

音频与语音处理 2026-04-07 v2

摘要

生成式通用语音增强(USE)方法旨在利用生成模型来改善各种失真条件下的语音质量。然而,现有的生成式语音增强方法在生成输出中经常出现语义不一致的问题。因此,我们提出 SenSE,一种新颖的两阶段生成式通用语音增强框架,通过语言模型对语义先验进行建模,引导基于流匹配的语音增强过程生成语义忠实的语音,从而有效提升上下文保真度。此外,我们引入了一种双路径掩码条件训练策略,使基于流匹配的增强能够灵活地整合来自退化语音、语义 token 和参考语音的多源条件信号,从而提高模型的灵活性与适应性。实验结果表明,SenSE 在生成式语音增强模型中实现了 SOTA 性能并展现出较高的性能上限,尤其在具有挑战性的失真条件下表现突出。代码和演示可在 https://github.com/ASLP-lab/SenSE 获取。

关键词

引用

@article{arxiv.2509.24708,
  title  = {SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement},
  author = {Xingchen Li and Hanke Xie and Ziqian Wang and Zihan Zhang and Longshuai Xiao and Shuai Wang and Lei Xie},
  journal= {arXiv preprint arXiv:2509.24708},
  year   = {2026}
}

备注

Accepted by ICME 2026