中文

CrossNet:利用全局、跨频带、窄带及位置编码进行单通道与多通道说话人分离

声音 2024-03-07 v1 音频与语音处理

摘要

我们提出了 CrossNet,一种用于混响和噪声条件下说话人分离与增强的复数谱映射方法。该架构包含一个编码器层、一个全局多头自注意力模块、一个跨频带模块、一个窄带模块以及一个输出层。CrossNet 能够捕捉时频域中的全局、跨频带和窄带相关性。为解决长语音 utterances 中的性能下降问题,我们引入了一种随机分块位置编码。在多个数据集上的实验结果证明了 CrossNet 的有效性和鲁棒性,在包括混响及噪声混响说话人分离在内的任务中实现了最先进(SOTA)的性能。此外,与最近的基线方法相比,CrossNet 展现出更快且更稳定的训练过程。另外,CrossNet 的高性能也扩展到了多麦克风条件,证明了其在各种声学场景中的通用性。

关键词

引用

@article{arxiv.2403.03411,
  title  = {CrossNet: Leveraging Global, Cross-Band, Narrow-Band, and Positional Encoding for Single- and Multi-Channel Speaker Separation},
  author = {Vahid Ahmadi Kalkhorani and DeLiang Wang},
  journal= {arXiv preprint arXiv:2403.03411},
  year   = {2024}
}

备注

9 pages