中文

用于语音分离的概率置换不变训练

音频与语音处理 2019-08-07 v1 机器学习 声音 机器学习

摘要

单麦克风、说话人无关的语音分离通常通过两步完成:(i)分离特定的语音源,以及(ii)确定最佳输出-标签分配以求得分离误差。第二步是训练语音分离神经网络的主要障碍。最近提出的置换不变训练(PIT)通过确定使分离误差最小的输出-标签分配来解决此问题。在本研究中,我们指出该技术的一个主要缺陷是对输出-标签分配的过度自信选择,尤其是在训练初期网络产生不可靠输出时。为解决此问题,我们提出概率置换不变训练(Prob-PIT),其将输出-标签置换视为具有均匀先验分布的离散潜在随机变量。Prob-PIT 基于先验分布和所有置换的分离误差定义对数似然函数;它通过最大化对数似然函数来训练语音分离网络。Prob-PIT 可通过将 PIT 的最小值函数替换为软最小值函数轻松实现。我们在 TIMIT 和 CHiME 数据集上评估了我们的语音分离方法。结果表明,所提方法在信失真比和信干扰比方面显著优于 PIT。

关键词

引用

@article{arxiv.1908.01768,
  title  = {Probabilistic Permutation Invariant Training for Speech Separation},
  author = {Midia Yousefi and Soheil Khorram and John H. L. Hansen},
  journal= {arXiv preprint arXiv:1908.01768},
  year   = {2019}
}

备注

Interspeech 2019