中文

关于语音源分离的置换不变训练

声音 2021-04-06 v2 人工智能 音频与语音处理

摘要

我们研究置换不变训练(PIT),其针对说话人无关源分离模型的置换模糊问题。我们扩展了两种最先进的PIT策略。首先,我们考察基于帧级PIT(tPIT)和聚类的两阶段说话人分离与跟踪算法,该算法最初针对STFT域提出,我们将其改造为在波形上及学习到的潜在空间中工作。此外,我们提出了一种可扩展至波形模型的高效聚类损失。其次,我们用基于“问题无关语音特征”的深度特征损失扩展最近提出的辅助说话人ID损失,以减少语句级PIT(uPIT)造成的局部置换错误。我们的结果表明,所提出的扩展有助于减少置换模糊。然而,我们也注意到,所研究的基于STFT的模型比基于波形的模型更能有效减少置换错误,这是近期研究中所忽视的一个视角。

关键词

引用

@article{arxiv.2102.04945,
  title  = {On permutation invariant training for speech source separation},
  author = {Xiaoyu Liu and Jordi Pons},
  journal= {arXiv preprint arXiv:2102.04945},
  year   = {2021}
}

备注

In proceedings of ICASSP2021