中文

通过并行谱-空間處理的移動說話者分離

音频与语音处理 2026-02-27 v1 声音

摘要

動態環境中的多路復說話分離具有挑戰性,因為時間變化的空間和頻譜特徵以不同的時間尺度演化。現有方法通常採用序列架構,迫使單一網路流同時建模兩種特徵,造成內在的建模衝突。本文提出了一個雙分支並行谱-空間(PS2)架構,通過並行流分別處理頻譜和空間特徵。頻譜分支使用基於雙向長短期記憶(BLSTM)的頻率模組、Mamba-based 時間模組和自注意力模組來建模頻譜特徵。空間分支採用雙向門控循環單元(BGRU)網路處理編碼說話者與麥克風之間演化幾何關係的空間特徵。通過交叉注意力融合機制將兩個分支的特徵整合,適應性地加權其貢獻。實驗結果表明,PS2 在移動說話者情況下較現有最先進(SOTA)方法高出 1.6-2.2 dB 的比例不變信號雜訊比(SI-SDR),在不同的混響時間(RT60)、噪聲水平和來源移動速度下均能保持穩定的分離品質。即使在快速來源運動情況下,所提模型仍能實現超過 13 dB 的 SI-SDR 改進。這些改進在多個數據集上均得到驗證,包括 WHAMR! 以及我們生成的 WSJ0-Demand-6ch-Move 数据集。

关键词

引用

@article{arxiv.2602.22487,
  title  = {Moving Speaker Separation via Parallel Spectral-Spatial Processing},
  author = {Yuzhu Wang and Archontis Politis and Konstantinos Drossos and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2602.22487},
  year   = {2026}
}

备注

Accepted by IEEE Transactions on Audio, Speech and Language Processing