人类与机器对英语电话对话语音的识别
计算与语言
2017-03-08 v1
摘要
最困难的语音识别任务之一是对人与人之间交流的准确识别。过去几年深度学习的进展,在代表性的Switchboard对话语料库上带来了重大的语音识别改进。短短几年前还高达14%的词错误率已降至8.0%,随后降至6.6%,最近更达到5.8%,目前被认为已接近人类表现水平。这随之引发了两个问题——人类表现究竟如何,以及我们还能将语音识别错误率降低到何种程度?微软最近的一篇论文暗示我们已经达到了人类表现水平。为了验证这一说法,我们在两项对话任务上独立进行了一组人类表现测量,发现人类表现可能远优于此前报告的结果,这为学界设定了一个更难企及的目标。我们还报告了自身在该领域的努力,提出了一套声学与语言建模技术,将我们自己的英语对话电话大词汇量连续语音识别(LVCSR)系统在Hub5 2000评测的Switchboard/CallHome子集上的词错误率降至5.5%/10.3%的水平,这——至少在撰写本文时——是一个新的性能里程碑(尽管尚未达到我们所测量的人类表现水平!)。在声学方面,我们使用了三个模型的分数融合:一个具有多特征输入的长短时记忆网络(LSTM),一个通过说话人对抗多任务学习训练的第二个LSTM,以及一个具有25个卷积层和时间膨胀卷积的第三个残差网络(ResNet)。在语言建模方面,我们使用了词级和字符级LSTM以及卷积WaveNet风格的语言模型。
引用
@article{arxiv.1703.02136,
title = {English Conversational Telephone Speech Recognition by Humans and Machines},
author = {George Saon and Gakuto Kurata and Tom Sercu and Kartik Audhkhasi and Samuel Thomas and Dimitrios Dimitriadis and Xiaodong Cui and Bhuvana Ramabhadran and Michael Picheny and Lynn-Li Lim and Bergul Roomi and Phil Hall},
journal= {arXiv preprint arXiv:1703.02136},
year = {2017}
}