引导源分离遇上强 ASR 后端:Hitachi/帕德博恩大学关于晚宴场景 ASR 的联合研究
计算与语言
2019-06-27 v2 声音
音频与语音处理
摘要
在本文中,我们展示了 Hitachi 与帕德博恩大学在晚宴场景下的自动语音识别(ASR)方面的联合工作。由多个麦克风阵列获取的晚宴录音的 ASR 系统所面临的主要挑战为:(1)严重的语音重叠,(2)强烈的噪声与混响,(3)非常自然的会话内容,以及可能的(4)训练数据不足。作为晚宴场景的一个示例,我们选用了 CHiME-5 语音识别挑战赛中提供的数据,其基线 ASR 的词错率(WER)为 73.3%,而即便 CHiME-5 挑战赛中表现最佳的系统的 WER 也达 46.1%。我们深入研究了引导源分离-based 语音增强技术与一种已提出的强 ASR 后端的组合,发现这些技术的紧密组合带来了显著的准确率提升。我们的最终系统在开发集和评估集上分别取得了 39.94% 和 41.64% 的 WER,二者均为该数据集上已发表的最佳结果。我们还利用 CHiME-5 语料库官方小数据之外的附加训练数据进行了研究,以评估该 ASR 任务的内在难度。
引用
@article{arxiv.1905.12230,
title = {Guided Source Separation Meets a Strong ASR Backend: Hitachi/Paderborn University Joint Investigation for Dinner Party ASR},
author = {Naoyuki Kanda and Christoph Boeddeker and Jens Heitkaemper and Yusuke Fujita and Shota Horiguchi and Kenji Nagamatsu and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:1905.12230},
year = {2019}
}
备注
Accepted to INTERSPEECH 2019