中文

引导训练:一种用于单通道说话人分离的简单方法

声音 2021-03-29 v1 人工智能 音频与语音处理

摘要

深度学习在语音分离方面展现出巨大潜力,尤其在语音与非语音分离上。然而,在目标与干扰均为语音的多说话人分离中,它遭遇排列问题。排列不变训练(PIT)被提出,通过对多个说话人顺序进行排列来解决该问题。另一种方式是使用锚定语音(目标说话人的短语音)来建模说话人身份。本文中,我们提出一种简单策略来训练长短期记忆(LSTM)模型以解决说话人分离中的排列问题。具体而言,我们在混合语音开头插入一段目标说话人的短语音作为引导信息。由此,最先出现的说话人被定义为目标。凭借在序列建模上的强大能力,LSTM可利用其记忆单元追踪并从干扰语音中分离出目标语音。实验结果表明所提训练策略对说话人分离是有效的。

关键词

引用

@article{arxiv.2103.14330,
  title  = {Guided Training: A Simple Method for Single-channel Speaker Separation},
  author = {Hao Li and Xueliang Zhang and Guanglai Gao},
  journal= {arXiv preprint arXiv:2103.14330},
  year   = {2021}
}

备注

5 pages