中文

基于多通道掩模的参考信道选择用于端到端多通道语音增强

音频与语音处理 2024-06-12 v2

摘要

在端到端多通道语音增强中,传统方法将一个麦克风信号指定为处理的参考信号,可能并不总能获得最佳结果。这种限制在大型分布式麦克风阵列( microphone 阵列)或具有较小尺寸且高度定向的麦克风阵列中尤为突出,这些阵列中的说话人或麦克风位置随时间而变化。当前的基于掩模的方法通常在训练时固定参考信道,这使得无法根据需要动态选择参考信道以获得最佳性能。为此,我们提出一种选择最佳参考信道的自适应方法。我们的方法利用基于多通道掩模的方案,将多个掩模信号组合生成单个单通道输出信号。该增强信号随后用于损失计算,而参考干净语音根据最高比例不变信噪比(SI-SDR)进行调整。在 Spear 挑战模拟数据集 D4 上的实验结果表明,我们提出的方法优于使用固定参考信道进行单通道掩模的传统方法。

关键词

引用

@article{arxiv.2406.03228,
  title  = {Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement},
  author = {Wang Dai and Xiaofei Li and Archontis Politis and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2406.03228},
  year   = {2024}
}

备注

Accepted by EUSIPCO 2024