LCANet:基于级联注意力-CTC 的端到端唇读网络
计算机视觉与模式识别
2018-03-15 v1
摘要
机器唇读是一种特殊类型的自动语音识别(ASR),它通过视觉解释包括嘴唇、面部和舌头在内的相关面部区域的运动来转写人类语音。最近,基于深度神经网络的唇读方法展现出巨大潜力,并在一些基准数据集上超过了经验丰富的人类唇读者的准确率。然而,唇读远未解决,现有方法在真实场景数据上往往具有较高错误率。在本文中,我们提出 LCANet,一种基于端到端深度神经网络的唇读系统。LCANet 使用堆叠的 3D 卷积神经网络(CNN)、高速网络和双向 GRU 网络对输入视频帧进行编码。该编码器有效捕获短期和长期时空信息。更重要的是,LCANet 结合了级联注意力-CTC 解码器来生成输出文本。通过将 CTC 与注意力级联,它部分消除了 CTC 在隐藏神经层内条件独立假设的缺陷,从而带来显著的性能提升以及更快的收敛。实验结果表明,所提系统在 GRID 语料库数据库上实现了 1.3% 的 CER 和 3.0% 的 WER,相比最先进方法带来了 12.3% 的提升。
引用
@article{arxiv.1803.04988,
title = {LCANet: End-to-End Lipreading with Cascaded Attention-CTC},
author = {Kai Xu and Dawei Li and Nick Cassimatis and Xiaolong Wang},
journal= {arXiv preprint arXiv:1803.04988},
year = {2018}
}
备注
FG 2018