中文

基于3D-2D-CNN、BLSTM-HMM与词级CTC模型的唇读

计算机视觉与模式识别 2019-07-01 v1 机器学习 声音 音频与语音处理 图像与视频处理

摘要

近年来,基于深度学习的机器唇读日益受到重视。为此,人们提出了若干架构,如LipNet、LCANet等,其性能远超在传统DCT特征上训练的混合DNN-HMM唇读系统。本工作中,我们提出了一种更简洁的带瓶颈层的3D-2D-CNN-BLSTM网络架构。我们还对该架构上两种不同唇读方法进行了分析。第一种方法中,3D-2D-CNN-BLSTM网络以字符CTC损失训练(ch-CTC),随后在传统ASR训练流程中于瓶颈唇部特征(提取自3D-2D-CNN-BLSTM ch-CTC网络)上训练BLSTM-HMM模型。第二种方法中,同一3D-2D-CNN-BLSTM网络以词标签CTC损失训练(w-CTC)。第一种方法表明瓶颈特征优于DCT特征。在Grid语料的可见说话人测试集上,第二种方法取得了1.3%1.3\%的词错率(WER),相对LCANet提升55%55\%。在不可见说话人测试集上,我们取得8.6%8.6\%的WER,相对LipNet提升24.5%24.5\%。我们还在自行采集的含8181名说话人的第二数据集上验证了该方法。最后,我们讨论了特征复制对BLSTM-HMM模型性能的影响。

关键词

引用

@article{arxiv.1906.12170,
  title  = {LipReading with 3D-2D-CNN BLSTM-HMM and word-CTC models},
  author = {Dilip Kumar Margam and Rohith Aralikatti and Tanay Sharma and Abhinav Thanda and Pujitha A K and Sharad Roy and Shankar M Venkatesan},
  journal= {arXiv preprint arXiv:1906.12170},
  year   = {2019}
}

备注

Submitted to Interspeech 2019