深度唇读:模型比较与在线应用
计算机视觉与模式识别
2018-06-18 v1
摘要
本文的目标是开发用于唇读——视觉语音识别——的最先进模型。我们开发了三种架构并比较其准确率和训练时间:(i)使用 LSTM 的循环模型;(ii)全卷积模型;(iii)近期提出的 transformer 模型。循环模型和全卷积模型采用 Connectionist Temporal Classification 损失训练,并使用显式语言模型进行解码,transformer 是一个序列到序列模型。我们性能最佳的模型在具有挑战性的 BBC-Oxford Lip Reading Sentences 2(LRS2)基准数据集上将最先进的词错误率降低了超过 20%。作为进一步贡献,我们研究了用于连续语音在线(实时)唇读的全卷积模型,并表明其以低延迟实现了高性能。
引用
@article{arxiv.1806.06053,
title = {Deep Lip Reading: a comparison of models and an online application},
author = {Triantafyllos Afouras and Joon Son Chung and Andrew Zisserman},
journal= {arXiv preprint arXiv:1806.06053},
year = {2018}
}
备注
To appear in Interspeech 2018