中文

基于级联双流的语音增强

音频与语音处理 2025-08-20 v3 信号处理

摘要

基于扩散概率模型的语音增强(SE)已展现出令人印象深刻的性能,但需要相对较高的函数评估次数。最近,基于流匹配的语音增强被提出,它以较小的函数评估次数表现出有竞争力的性能。早期方法仅采用带噪语音作为唯一的条件变量。还有其他方法利用经预测模型增强的语音作为另一个条件变量并采样初始值,但它们需要在生成式语音增强模型之外再使用一个单独的预测模型。在本工作中,我们提出采用一个基于流匹配的相同模型,同时用于语音增强和生成用作初始起点及条件变量的增强语音。实验结果表明,即使采用两个级联的生成方法,所提方法所需的函数评估次数相同或更少,同时取得了与先前基线相当或更好的性能。

关键词

引用

@article{arxiv.2508.06842,
  title  = {Speech Enhancement based on cascaded two flows},
  author = {Seonggyu Lee and Sein Cheong and Sangwook Han and Kihyuk Kim and Jong Won Shin},
  journal= {arXiv preprint arXiv:2508.06842},
  year   = {2025}
}

备注

Accepted at Interspeech 2025