使用卷积自编码器作为特征提取器的唇读
计算机视觉与模式识别
2018-06-01 v1
摘要
利用唇部运动进行语音的视觉识别称为唇读。这一新兴领域近期的发展使用不同的神经网络作为特征提取器,并作为可映射时间关系并进行分类的模型的输入。尽管端到端句子级唇读是当前趋势,我们提出了一种采用词级分类的新模型,并打破了标准数据集的既定基准。在我们的模型中,我们使用卷积自编码器作为特征提取器,随后将其输入长短期记忆(LSTM)模型。我们在 BBC 的 LRW 数据集、MIRACL-VC1 和 GRID 数据集上测试了所提模型。在 MIRACL-VC1 上取得了 98% 的分类准确率,而既定基准为 93.4%(Rekik 等,2014)。在 BBC 的 LRW 上,所提模型优于卷积神经网络与长短期记忆模型的基线模型(Garg 等,2016)。通过展示模型学到的特征,我们清楚地说明了所提模型为何优于基线模型。同一模型也可扩展用于端到端句子级分类。
引用
@article{arxiv.1805.12371,
title = {Lip Reading Using Convolutional Auto Encoders as Feature Extractor},
author = {Dharin Parekh and Ankitesh Gupta and Shharrnam Chhatpar and Anmol Yash Kumar and Manasi Kulkarni},
journal= {arXiv preprint arXiv:1805.12371},
year = {2018}
}
备注
6 pages, 6 tables, 9 Figures