场景感知远场自动语音识别
音频与语音处理
2021-04-23 v1 声音
摘要
我们提出了一种用于生成场景感知远场自动语音识别训练数据的新方法。我们使用基于深度学习的估计器,从环境的语音样本中非侵入式地计算其子带混响时间。我们用混响时间对场景的声学特性建模,并用多元高斯分布表示它。我们利用该分布从大型真实世界数据集中选择声学脉冲响应以增强语音数据。在我们的场景感知数据上训练的语音识别系统在 REVERB 和 AMI 远场基准上持续优于使用更多随机声学脉冲响应训练的系统。在实践中,与使用同样大小且混响时间均匀分布的训练数据相比,我们获得了词错误率 2.64% 的绝对提升。
引用
@article{arxiv.2104.10757,
title = {Scene-aware Far-field Automatic Speech Recognition},
author = {Zhenyu Tang and Dinesh Manocha},
journal= {arXiv preprint arXiv:2104.10757},
year = {2021}
}