中文

保留空间线索的实时双耳语音分离

音频与语音处理 2020-02-18 v1 声音

摘要

深度学习语音分离算法在提升混合音频中分离语音的质量与可懂度方面已取得巨大成功。以往多数方法侧重于为每个目标说话人生成单通道输出,因而丢弃了空间中对声源定位所需的空间线索。然而,在许多旨在精确渲染声学场景的应用中(如助听器和增强现实(AR)),保留空间信息十分重要。在此,我们提出一种语音分离算法,可保留分离声源的耳间线索,并能以低延迟和高保真实现,从而支持对声学场景的实时修改。基于时域音频分离网络(TasNet)——一种可实时实现的单通道时域语音分离系统——我们提出TasNet的多输入多输出(MIMO)端到端扩展,以双耳混合音频作为输入并同时在双通道中分离目标说话人。实验结果表明,所提出的端到端MIMO系统能够显著提升分离性能,并在各种声学场景中保持被修改声源的感知位置不变。

关键词

引用

@article{arxiv.2002.06637,
  title  = {Real-time binaural speech separation with preserved spatial cues},
  author = {Cong Han and Yi Luo and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2002.06637},
  year   = {2020}
}

备注

To appear in ICASSP 2020