中文

ArrayDPS-Refine:基于干净语音扩散先验的判别式多通道语音增强细化

音频与语音处理 2026-03-26 v1

摘要

多通道语音增强旨在从噪声多通道录音中恢复干净语音。大多数深度学习方法采用判别式训练, 在面对挑战性环境噪声条件时,可能导致基于回归目标的非线性失真。灵感来自用于无监督多通道源分离的 ArrayDPS,我们引入 ArrayDPS-Refine,一种旨�增强判别式模型输出的、基于干净语音扩散先验的方法。ArrayDPS-Refine 无需训练、为生成式且对阵列agnostic。它首先从判别式模型产生的增强语音中估计噪声空间协方差矩阵(SCM),然后使用该估计噪声 SCM 进行扩散后验采样。该方法允许在无需重新训练的情况下直接细化任何判别式模型的输出。我们的实验结果表明,ArrayDPS-Refine 在改进各种判别式模型性能方面始终如一地有效,包括最先进的时域波形模型和 STFT 域模型。提供了音频演示链接:https://xzwy.github.io/ArrayDPSRefineDemo/。

关键词

引用

@article{arxiv.2603.24385,
  title  = {ArrayDPS-Refine: Generative Refinement of Discriminative Multi-Channel Speech Enhancement},
  author = {Zhongweiyang Xu and Ashutosh Pandey and Juan Azcarreta and Zhaoheng Ni and Sanjeel Parekh and Buye Xu},
  journal= {arXiv preprint arXiv:2603.24385},
  year   = {2026}
}

备注

Accepted to ICASSP 2026