一种用于单声道通用语音增强的预测-生成复合方法
音频与语音处理
2025-06-02 v1
摘要
设计一个能够抑制各种失真并提高语音质量的单一模型,即通用语音增强(USE),具有广阔前景。与基于监督学习的预测方法相比,基于扩散的生成模型由于具备从信息严重受损的退化语音中进行生成的能力,展现出了更大的潜力。然而,在高度不利的条件下可能会引入伪影,且扩散模型常因推理步骤众多而承受沉重的计算负担。为了共同利用预测和生成的优势并克服各自的缺陷,在本工作中,我们提出了一种名为 PGUSE 的通用语音增强模型,它结合了预测建模和生成建模。我们的模型由两个分支组成:预测分支直接从退化信号中预测干净样本,而生成分支优化扩散模型去噪目标。我们利用输出融合和截断扩散方案来有效整合预测和生成建模,其中前者直接合并两个分支的结果,后者利用预测分支的初始估计来修改逆扩散过程。在多个数据集上的大量实验验证了所提模型相对于 SOTA 基线的优越性,证明了结合预测和生成建模的互补性与优势。
引用
@article{arxiv.2505.24576,
title = {A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement},
author = {Jie Zhang and Haoyin Yan and Xiaofei Li},
journal= {arXiv preprint arXiv:2505.24576},
year = {2025}
}
备注
Accepted by IEEE Transactions on Audio, Speech and Language Processing