基于多通道掩模的参考信道选择用于端到端多通道语音增强
音频与语音处理
2024-06-12 v2
摘要
在端到端多通道语音增强中,传统方法将一个麦克风信号指定为处理的参考信号,可能并不总能获得最佳结果。这种限制在大型分布式麦克风阵列( microphone 阵列)或具有较小尺寸且高度定向的麦克风阵列中尤为突出,这些阵列中的说话人或麦克风位置随时间而变化。当前的基于掩模的方法通常在训练时固定参考信道,这使得无法根据需要动态选择参考信道以获得最佳性能。为此,我们提出一种选择最佳参考信道的自适应方法。我们的方法利用基于多通道掩模的方案,将多个掩模信号组合生成单个单通道输出信号。该增强信号随后用于损失计算,而参考干净语音根据最高比例不变信噪比(SI-SDR)进行调整。在 Spear 挑战模拟数据集 D4 上的实验结果表明,我们提出的方法优于使用固定参考信道进行单通道掩模的传统方法。
引用
@article{arxiv.2406.03228,
title = {Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement},
author = {Wang Dai and Xiaofei Li and Archontis Politis and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2406.03228},
year = {2024}
}
备注
Accepted by EUSIPCO 2024