中文

基于软最小值置换不变训练的单通道语音分离

音频与语音处理 2021-11-17 v1 机器学习 声音

摘要

语音分离的目标是从单麦克风录音中提取多个语音源。近年来,随着深度学习的进步和大型数据集的可用,语音分离已被表述为一个监督学习问题。这些方法旨在使用监督学习算法(通常是深度神经网络)来学习语音、说话人和背景噪声的判别模式。监督语音分离中一个长期存在的问题是为每个分离出的语音信号找到正确的标签,称为标签置换模糊性。置换模糊性指的是确定分离源与可用的单说话人语音标签之间的输出-标签分配的问题。找到最佳输出-标签分配是计算分离误差所必需的,该误差随后用于更新模型参数。最近,置换不变训练(PIT)已被证明是处理标签模糊性问题的一种有前景的解决方案。然而,PIT对输出-标签分配的过度自信选择导致训练出的模型次优。在这项工作中,我们提出了一个概率优化框架来解决PIT在寻找最佳输出-标签分配时的低效问题。我们提出的名为可训练软最小值PIT的方法随后被应用于置换不变训练(PIT)语音分离方法所使用的相同长短期记忆(LSTM)架构上。我们的实验结果表明,所提出的方法在信号失真比(SDR)上提升+1dB、在信号干扰比(SIR)上提升+1.5dB,显著优于传统PIT语音分离(p值 <0.01 < 0.01)。

关键词

引用

@article{arxiv.2111.08635,
  title  = {Single-channel speech separation using Soft-minimum Permutation Invariant Training},
  author = {Midia Yousefi and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2111.08635},
  year   = {2021}
}