中文

缩小时域多通道语音增强在真实与仿真条件间的差距

音频与语音处理 2021-10-28 v1 声音

摘要

基于深度学习的时域模型,例如 Conv-TasNet,在单通道和多通道语音增强中均展现出巨大潜力。然而,许多关于时域语音增强模型的实验是在仿真条件下完成的,其在真实场景中的良好性能能否泛化尚未得到充分研究。在本文中,我们旨在对多通道 Conv-TasNet 语音增强在仿真与真实数据上的应用进行深入的探究。我们的初步实验显示,在 ASR 性能方面,两种条件之间存在较大的性能差距。我们应用了若干方法来缩小这一差距,包括将多通道 Conv-TasNet 以不同策略集成到波束形成模型中,以及语音增强与语音识别模型的联合训练。我们在 CHiME-4 语料库上的实验表明,所提方法能大幅降低仿真与真实数据间的语音识别性能差异,同时保持前端强大的语音增强能力。

关键词

引用

@article{arxiv.2110.14139,
  title  = {Closing the Gap Between Time-Domain Multi-Channel Speech Enhancement on Real and Simulation Conditions},
  author = {Wangyou Zhang and Jing Shi and Chenda Li and Shinji Watanabe and Yanmin Qian},
  journal= {arXiv preprint arXiv:2110.14139},
  year   = {2021}
}

备注

5 pages, 3 figures, accepted by IEEE WASPAA 2021