中文

UNSSOR:利用过定训练混合信号的无监督神经语音分离

声音 2023-10-31 v2 机器学习 音频与语音处理

摘要

在含多个同时说话人的混响环境中,每个麦克风在不同位置采集到多个说话人的混合信号。在麦克风数多于说话人的过定条件下,我们可将解限定为说话人图像,并通过将每个混合信号作为约束(即某麦克风处估计的说话人图像之和应等于该混合信号)来实现无监督语音分离。基于这一见解,我们提出UNSSOR,一种利用过定训练混合信号的无监督神经语音分离算法。在每步训练中,我们将输入混合信号送入深度神经网络(DNN)以产生各说话人的中间估计,对估计进行线性滤波,并优化一个损失,使得在每个麦克风处所有说话人的滤波估计相加等于混合信号以满足上述约束。我们表明该损失能促进说话人的无监督分离。线性滤波器通过在每个子带基于混合信号与DNN估计经前向卷积预测(FCP)算法计算。为解决使用子带FCP引发的频率排列问题,提出了一种基于最小化源内幅度散射的损失项。尽管UNSSOR需要过定训练混合信号,我们仍可训练DNN实现欠定分离(例如无监督单通道语音分离)。在混响条件下双说话人分离上的评估结果展示了UNSSOR的有效性与潜力。

关键词

引用

@article{arxiv.2305.20054,
  title  = {UNSSOR: Unsupervised Neural Speech Separation by Leveraging Over-determined Training Mixtures},
  author = {Zhong-Qiu Wang and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2305.20054},
  year   = {2023}
}

备注

in Conference on Neural Information Processing Systems (NeurIPS), 2023