大规模视觉语音识别
计算机视觉与模式识别
2018-10-02 v3 机器学习
摘要
本工作提出了一种开放词表视觉语音识别的可扩展解决方案。为此,我们构建了现有最大的视觉语音识别数据集,由文本与说话人脸视频片段的配对组成(3886 小时视频)。同时,我们设计并训练了一个集成的唇读系统,包括一个将原始视频映射为稳定的嘴唇视频及音素序列的视频处理流水线、一个将嘴唇视频映射为音素分布序列的可扩展深度神经网络,以及一个输出词序列的生产级语音解码器。所提出的系统在留出集上测得的词错误率(WER)为 40.9%。相比之下,专业唇读者在可获取额外类型上下文信息时,在同一数据集上分别达到 86.4% 或 92.9% 的 WER。我们的方法显著优于其他唇读方法,包括 LipNet 和 Watch, Attend, and Spell (WAS) 的变体,它们分别只能达到 89.8% 和 76.8% 的 WER。
引用
@article{arxiv.1807.05162,
title = {Large-Scale Visual Speech Recognition},
author = {Brendan Shillingford and Yannis Assael and Matthew W. Hoffman and Thomas Paine and Cían Hughes and Utsav Prabhu and Hank Liao and Hasim Sak and Kanishka Rao and Lorrayne Bennett and Marie Mulville and Ben Coppin and Ben Laurie and Andrew Senior and Nando de Freitas},
journal= {arXiv preprint arXiv:1807.05162},
year = {2018}
}