中文

基于源对比估计的单声道音频说话人分离

声音 2017-05-22 v1 人工智能 机器学习 机器学习

摘要

我们提出一种算法,利用单个麦克风将同时说话的人彼此分离,即“鸡尾酒会问题”。我们的方法涉及深度循环神经网络回归到一个描述独立说话人的向量空间。这样的向量空间可以嵌入经验确定的说话人特征,并通过区分说话人掩码来优化。我们称此技术为源对比估计。该方法受负采样的启发,负采样在自然语言处理中已取得成功,其通过学习给定输入向量与输出权重的关联与去关联来学习嵌入。尽管由输出权重确定的矩阵依赖于一组已知说话人,我们在推断时仅使用输入向量。这样做将确保源分离显式地与说话人无关。我们的方法类似于最近的深度神经网络聚类和排列不变训练研究;我们使用加权谱特征和掩码来增强个体说话人频率,同时过滤掉其他说话人。然而,我们通过我们的技术避免了其他方法严重的计算负担。此外,通过训练向量空间而非不同说话人的组合或其差异,我们在训练期间避免了所谓的排列问题。我们的算法为鸡尾酒会问题提供了直观、计算高效的响应,并且最重要的是拥有比其他当前技术更好的经验性能。

关键词

引用

@article{arxiv.1705.04662,
  title  = {Monaural Audio Speaker Separation with Source Contrastive Estimation},
  author = {Cory Stephenson and Patrick Callier and Abhinav Ganesh and Karl Ni},
  journal= {arXiv preprint arXiv:1705.04662},
  year   = {2017}
}