中文

基于 Wavesplit 网络的移动说话人在线双耳语音分离

音频与语音处理 2023-03-15 v1 声音

摘要

真实场景中的双耳语音分离常涉及移动说话人。当前大多数语音分离方法采用语句级置换不变训练(u-PIT)进行训练。然而在推理时,输出的顺序可能随时间不一致,尤其在长时长语音分离中。这种情况被称为说话人交换问题,当说话人在空间中持续移动时更为严重,从而对输出通道中说话人的一致放置提出挑战。在此,我们描述了一种基于 Wavesplit 网络的实时双耳语音分离模型,以缓解移动说话人分离中的说话人交换问题。我们的模型在每一时间帧从混合音频中为每位说话人计算说话人嵌入,使用在线聚类聚合嵌入,并将聚类质心作为说话人轮廓以在长时间内跟踪每位说话人。在混响、长时长移动多说话人语音分离上的实验结果表明,所提方法更不易发生说话人交换,并在分离精度与双耳线索保持方面取得了与基于 u-PIT 且使用真实跟踪的模型相当的性能。

关键词

引用

@article{arxiv.2303.07458,
  title  = {Online Binaural Speech Separation of Moving Speakers With a Wavesplit Network},
  author = {Cong Han and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2303.07458},
  year   = {2023}
}

备注

To appear in ICASSP 2023