中文

重叠语音识别的声学建模:JHU CHiME-5 挑战系统

音频与语音处理 2024-05-21 v1

摘要

本文概述了我们在约翰霍普金斯大学语音识别系统中进行的声学建模工作,该系统用于识别通过多个麦克风阵列记录的高度重叠晚餐派对语音。我们探索了数据增强方法、神经网络架构、前端声学消混、波束成形和稳健 i 向量提取,并比较了我们的内部实现和公开工具。我们最终在开发集上实现了 69.4% 的词错误率,这是对之前基线 81.1% 的 11.7% 绝对改进,并发布了以改进的基线和精炼技术/工具为代表的高级 CHiME-5 食谱。

关键词

引用

@article{arxiv.2405.11078,
  title  = {Acoustic modeling for Overlapping Speech Recognition: JHU Chime-5 Challenge System},
  author = {Vimal Manohar and Szu-Jui Chen and Zhiqi Wang and Yusuke Fujita and Shinji Watanabe and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2405.11078},
  year   = {2024}
}

备注

Published in: ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)