中文

将确定性增强条件与双流编码结合用于扩散-based语音增强

声音 2025-10-08 v2 音频与语音处理

摘要

扩散-based语音增强 (SE) 模型需要将正确的先验知识作为可靠条件来生成准确的预测。然而,使用噪声特征提供可靠条件具有挑战性。一个解决方案是使用由确定性方法增强的特征作为条件。然而,确定性方法导致的信息失真和损失可能会影响扩散过程。本文首先研究了使用不同确定性SE模型作为条件的效果。我们验证了两种条件是否将噪声特征作为条件的一部分:一种是仅使用确定性特征 (deterministic-only),另一种是同时使用确定性和噪声特征 (deterministic-noisy)。初步调查发现,使用确定性增强条件在真实数据上改善了听觉体验,而是否使用确定性-only 或确定性-噪声条件的选择取决于所使用的确定性模型。基于这些发现,我们提出了一种用于SE的双流编码修复-扩散模型 (DERDM-SE),更有效地利用两者。此外,我们发现,粗粒度和细粒度模型在客观评估指标上都有更大的潜力,而基于 UNet 的确定性模型提供更稳定的扩散性能。因此,在 DERDM-SE 中,我们提出了一种结合粗粒度和细粒度处理的确定性模型。在 CHiME4 上的实验结果表明,所提出的模型有效地利用确定性模型实现了更好的SE评估分数,同时表现出比其他扩散-based SE 模型更稳定的性能。

关键词

引用

@article{arxiv.2505.13983,
  title  = {Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement},
  author = {Hao Shi and Xugang Lu and Kazuki Shimada and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2505.13983},
  year   = {2025}
}