面向多通道语音增强与分离的统一扩散精炼
音频与语音处理
2026-03-27 v1
摘要
我们提出 Uni-ArrayDPS,一个新的基于扩散的精炼框架,用于统一的多通道语音增强与分离。现有的多通道语音增强/分离方法大多为判别式,能够在高信噪比输出方面效果显著,但仍会产生由神经网络和回归目标引入的非线性失真,导致语音听感不自然。为此,我们提出 Uni-ArrayDPS,该方法利用语音扩散先验对判别式模型的输出进行精炼。Uni-ArrayDPS 为生成式、与阵列无关且无需训练的框架,支持增强和分离任务。给定判别式模型增强/分离后的语音,我们使用该模型以及噪声混合信号,估计噪声的空间协方差矩阵(SCM),随后利用该 SCM 计算扩散后验采样所需的似然函数,以获得干净语音源(s)。Uni-ArrayDPS 只需一个预训练的干净语音扩散模型作为先验,无需额外训练或微调,能够直接跨任务(增强/分离)、阵列几何和判别式模型骨干网络进行泛化。大量实验表明,Uni-ArrayDPS 在广泛的判别式模型上, consistently 改善了增强和分离任务。我们还在真实世界数据集上取得了优异成绩。音频演示请参见 \href{https://xzwy.github.io/Uni-ArrayDPS/}{https://xzwy.github.io/Uni-ArrayDPS/}。
引用
@article{arxiv.2603.24810,
title = {Unified Diffusion Refinement for Multi-Channel Speech Enhancement and Separation},
author = {Zhongweiyang Xu and Ashutosh Pandey and Juan Azcarreta and Zhaoheng Ni and Sanjeel Parekh and Buye Xu and Romit Roy Choudhury},
journal= {arXiv preprint arXiv:2603.24810},
year = {2026}
}
备注
Paper in submission