中文

通过多说话人表示提升源分离性能

声音 2017-08-30 v1

摘要

近期,深度学习在解决鸡尾酒会问题方面取得了新颖进展。初步结果非常有前景,为该领域的进一步研究提供了可能。在针对该任务的神经网络方法中,尚未被探索的一项技术是说话人自适应。直观上看,关于待分离说话人的信息对于说话人分离任务似乎至关重要。然而,获取这些说话人信息具有挑战性,因为说话人身份并非先验已知,且多个说话人同时活跃。因此,这存在某种“鸡生蛋、蛋生鸡”的问题。为解决这一问题,我们交替估计源信号和 i-vector。我们表明,盲多说话人自适应提升了网络的性能,并且(在我们的案例中)网络本身无法充分提取这些有用的说话人信息。

关键词

引用

@article{arxiv.1708.08740,
  title  = {Improving Source Separation via Multi-Speaker Representations},
  author = {Jeroen Zegers and Hugo Van hamme},
  journal= {arXiv preprint arXiv:1708.08740},
  year   = {2017}
}