缩小时域多通道语音增强在真实与仿真条件间的差距
音频与语音处理
2021-10-28 v1 声音
摘要
基于深度学习的时域模型,例如 Conv-TasNet,在单通道和多通道语音增强中均展现出巨大潜力。然而,许多关于时域语音增强模型的实验是在仿真条件下完成的,其在真实场景中的良好性能能否泛化尚未得到充分研究。在本文中,我们旨在对多通道 Conv-TasNet 语音增强在仿真与真实数据上的应用进行深入的探究。我们的初步实验显示,在 ASR 性能方面,两种条件之间存在较大的性能差距。我们应用了若干方法来缩小这一差距,包括将多通道 Conv-TasNet 以不同策略集成到波束形成模型中,以及语音增强与语音识别模型的联合训练。我们在 CHiME-4 语料库上的实验表明,所提方法能大幅降低仿真与真实数据间的语音识别性能差异,同时保持前端强大的语音增强能力。
引用
@article{arxiv.2110.14139,
title = {Closing the Gap Between Time-Domain Multi-Channel Speech Enhancement on Real and Simulation Conditions},
author = {Wangyou Zhang and Jing Shi and Chenda Li and Shinji Watanabe and Yanmin Qian},
journal= {arXiv preprint arXiv:2110.14139},
year = {2021}
}
备注
5 pages, 3 figures, accepted by IEEE WASPAA 2021