挑战语音识别的边界:MALACH语料库
计算与语言
2019-08-12 v1 声音
音频与语音处理
摘要
过去几年中,语音识别取得了巨大进展。曾经被认为极其困难的任务,如SWITCHBOARD,现已接近人类表现水平。MALACH语料库(LDC目录LDC2012S05)是由Shoah视觉历史基金会收集的庞大 Holocaust 证词档案的375小时子集,给语音界带来了重大挑战。该集合由不受约束的自然语音组成,充满不流利现象、浓重口音、与年龄相关的协同发音、无提示的说话人与语言切换,以及情感语音——这些仍是语音识别系统尚未解决的开放问题。即便对于熟练的人类标注者,转写也颇具挑战。本文建议学界将焦点置于MALACH语料库,以开发对口音、不流利现象和情感语音更具鲁棒性的语音识别系统。为降低入门门槛,我们创建了词典及训练与测试设置,并给出了使用当前深度学习技术的基线结果。该元数据已由LDC发布(LDC2019S11)。希望此资源能使学界在这些基线上继续构建,从而使这些及相关口述历史中极为重要的信息能被更广泛的受众获取。
引用
@article{arxiv.1908.03455,
title = {Challenging the Boundaries of Speech Recognition: The MALACH Corpus},
author = {Michael Picheny and Zóltan Tüske and Brian Kingsbury and Kartik Audhkhasi and Xiaodong Cui and George Saon},
journal= {arXiv preprint arXiv:1908.03455},
year = {2019}
}
备注
Accepted for publication at INTERSPEECH 2019