中文

基于深度学习的单麦克风语音增强与分离

声音 2018-12-05 v2 音频与语音处理

摘要

鸡尾酒会问题包含一项极具挑战性的任务,即在复杂的声学环境中理解语音信号,其中多个说话人与背景噪声信号同时干扰目标语音信号。在此类复杂声学情形下,能够有效提升语音信号可懂度与质量的信号处理算法是迫切需要的,尤其是对于涉及移动通信设备与助听设备的应用。由于机器学习技术(今称深度学习)的复兴,此类算法所涉及的挑战或许可以被克服。在本篇博士论文中,我们研究并开发了针对鸡尾酒会问题两个子领域的基于深度学习的技术:单麦克风语音增强与单麦克风多说话人语音分离。具体而言,我们对现代基于深度学习的单麦克风语音增强算法的泛化能力进行了深入的实证分析。我们表明,此类算法的性能与训练数据密切相关,且通过精心设计的训练数据可实现良好的泛化能力。此外,我们提出了uPIT,一种基于深度学习的单麦克风语音分离算法,并在说话人无关的多说话人语音分离任务上报告了最先进(state-of-the-art)的结果。另外,我们展示了uPIT在无需关于噪声类型或说话人数的显式先验知识的情况下,对联合语音分离与增强同样表现良好。最后,我们表明,为最小化经典短时谱幅度均方误差而设计的基于深度学习的语音增强算法,所增强的语音信号就STOI(一种最先进的语音可懂度估计器)而言本质上是最优的。

关键词

引用

@article{arxiv.1808.10620,
  title  = {Single-Microphone Speech Enhancement and Separation Using Deep Learning},
  author = {Morten Kolbæk},
  journal= {arXiv preprint arXiv:1808.10620},
  year   = {2018}
}

备注

PhD Thesis. 233 pages