相位感知、耳条件化的多通道立体声说话人分离
音频与语音处理
2025-10-14 v1
摘要
在回声环境中分离竞争语音需要保留空间线索同时保持分离效率的模型。我们提出了使用八个麦克风的 Phase-aware Ear-conditioned speaker Separation 网络 (PEASE-8),其消耗复杂 STFT 并直接将原始-STFT 输入引入早期解码器层,绕过整个编码器路径以提高重构。该模型以 SI-SDR 基于的目标在端到端训练中进行分离和去回声,用于固定方位两个说话人的直接声线目标,消除 permutation invariant training 的需求。在覆盖 anechoic、回声和噪声条件的空间化双说话人混合信号上,PEASE-8 提供了强大的分离和可理解性。在回声环境中,它实现了 12.37 dB SI-SDR、0.87 STOI 和 1.86 PESQ 当 T60 = 0.6 s,而在无回声条件下仍保持竞争力。
引用
@article{arxiv.2510.11366,
title = {Phase Aware Ear-Conditioned Learning for Multi-Channel Binaural Speaker Separation},
author = {Ruben Johnson Robert Jeremiah and Peyman Goli and Steven van de Par},
journal= {arXiv preprint arXiv:2510.11366},
year = {2025}
}