基于3D-2D-CNN、BLSTM-HMM与词级CTC模型的唇读
计算机视觉与模式识别
2019-07-01 v1 机器学习
声音
音频与语音处理
图像与视频处理
摘要
近年来,基于深度学习的机器唇读日益受到重视。为此,人们提出了若干架构,如LipNet、LCANet等,其性能远超在传统DCT特征上训练的混合DNN-HMM唇读系统。本工作中,我们提出了一种更简洁的带瓶颈层的3D-2D-CNN-BLSTM网络架构。我们还对该架构上两种不同唇读方法进行了分析。第一种方法中,3D-2D-CNN-BLSTM网络以字符CTC损失训练(ch-CTC),随后在传统ASR训练流程中于瓶颈唇部特征(提取自3D-2D-CNN-BLSTM ch-CTC网络)上训练BLSTM-HMM模型。第二种方法中,同一3D-2D-CNN-BLSTM网络以词标签CTC损失训练(w-CTC)。第一种方法表明瓶颈特征优于DCT特征。在Grid语料的可见说话人测试集上,第二种方法取得了的词错率(WER),相对LCANet提升。在不可见说话人测试集上,我们取得的WER,相对LipNet提升。我们还在自行采集的含名说话人的第二数据集上验证了该方法。最后,我们讨论了特征复制对BLSTM-HMM模型性能的影响。
引用
@article{arxiv.1906.12170,
title = {LipReading with 3D-2D-CNN BLSTM-HMM and word-CTC models},
author = {Dilip Kumar Margam and Rohith Aralikatti and Tanay Sharma and Abhinav Thanda and Pujitha A K and Sharad Roy and Shankar M Venkatesan},
journal= {arXiv preprint arXiv:1906.12170},
year = {2019}
}
备注
Submitted to Interspeech 2019