中文

用于语音增强与分离的预测-生成漂移分解

音频与语音处理 2026-05-08 v1 机器学习

摘要

我们提出了一个用于语音增强与分离的即插即用框架,该框架利用生成式语音先验来增强预测方法。我们的方法称为语音随机插值先验(Stochastic Interpolant Prior for Speech, SIPS),建立在随机插值的基础上,并利用其灵活性来桥接预测建模与生成建模。具体而言,我们将插值动力学分解为特定任务的漂移和随机去噪分量,从而允许将预测估计直接集成到生成采样过程中。这产生了一个数学上有根据的框架,用于将强大的预训练预测器与生成模型的表达能力相结合。为此,我们仅使用纯净语音训练了一个分数模型,产生了一种与退化无关的先验,可跨任务重用。在推理过程中,预测器提供确定性漂移,将采样过程引导至与任务一致的估计,而分数模型则保持感知自然性。与通常依赖特定架构条件并绑定于特定预测器或退化设置的先前混合方法不同,SIPS 提供了一个统一框架,可泛化至各种预测器和加性退化任务。我们使用 SEMamba 和 FlexIO 等最新预测器展示了其在语音增强和语音分离中的有效性。所提方法持续提升了感知质量,在语音分离中实现了高达 +1.0 NISQA 的增益。

关键词

引用

@article{arxiv.2605.06189,
  title  = {Predictive-Generative Drift Decomposition for Speech Enhancement and Separation},
  author = {Julius Richter and Yoshiki Masuyama and Christoph Boeddeker and Takahiro Edo and Gordon Wichern and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2605.06189},
  year   = {2026}
}

备注

Submitted to NeurIPS 2026