JHU 用于 CHiME-6 挑战赛的多麦克风多说话人 ASR 系统
音频与语音处理
2020-06-16 v1 声音
摘要
本文总结了 JHU 团队在 CHiME-6 挑战赛赛道 1 和赛道 2 中的工作,该挑战赛针对日常家庭环境中的远场多麦克风对话语音分离与识别。我们在流水线的每个阶段探索了多阵列处理技术,例如用于增强和声学模型训练数据的多阵列引导源分离 (GSS)、用于语音活动检测的后验融合、用于说话人分离的 PLDA 分数融合,以及用于自动语音识别 (ASR) 的格点组合。我们还报告了不同声学模型架构的结果,并集成了其他技术,如在线多通道加权预测误差 (WPE) 去混响和基于变分贝叶斯-隐马尔可夫模型 (VB-HMM) 的重叠分配,以分别处理混响和重叠说话人。由于这些努力,我们的 ASR 系统在评估集上,赛道 1 和赛道 2 的词错误率分别达到了 40.5% 和 67.5%。这比相应赛道的挑战基线分别绝对提升了 10.8% 和 10.4%。
引用
@article{arxiv.2006.07898,
title = {The JHU Multi-Microphone Multi-Speaker ASR System for the CHiME-6 Challenge},
author = {Ashish Arora and Desh Raj and Aswin Shanmugam Subramanian and Ke Li and Bar Ben-Yair and Matthew Maciejewski and Piotr Żelasko and Paola García and Shinji Watanabe and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2006.07898},
year = {2020}
}
备注
Presented at the CHiME-6 workshop (colocated with ICASSP 2020)