AMDM-SE:用于语音增强的基于注意力的多通道扩散模型
音频与语音处理
2026-01-21 v1
摘要
扩散模型最近在从含噪输入重建图像方面取得了令人瞩目的成果,类似的思想也被应用于语音增强,即将时频表示视为图像。随着多麦克风设备的普及,我们扩展了最先进的基于扩散的方法,以利用多通道输入来获得更好的性能。基于多通道扩散的增强仍处于起步阶段,先前的工作对注意力等用于空间建模的先进机制的利用有限——本文填补了这一空白。我们提出了 AMDM-SE,一种用于语音增强的基于注意力的多通道扩散模型 (Attention-based Multichannel Diffusion Model for Speech Enhancement),专为降噪而设计。AMDM-SE 通过一种新颖的跨通道时频注意力块利用空间通道间信息,从而在生成式扩散框架内忠实地重建细粒度的信号细节。在 CHiME-3 基准上,AMDM-SE 优于单通道扩散基线、无注意力的多通道模型以及强大的基于 DNN 的预测方法。模拟数据实验进一步强调了所提出的多通道注意力机制的重要性。总体而言,我们的结果表明,将目标多通道注意力纳入扩散模型可显著改善降噪效果。虽然基于多通道扩散的语音增强仍是一个新兴领域,但我们的工作为这一方向不断增长的研究提供了一个新的、互补的方法。
引用
@article{arxiv.2601.13140,
title = {AMDM-SE: Attention-based Multichannel Diffusion Model for Speech Enhancement},
author = {Renana Opochinsky and Sharon Gannot},
journal= {arXiv preprint arXiv:2601.13140},
year = {2026}
}