利用残差网络与 LSTMs 推进视听词识别的边界
计算机视觉与模式识别
2018-11-06 v1
摘要
视觉与视听语音识别正经历复兴,这在很大程度上归功于深度学习方法的出现。在本文中,我们提出了一种用于唇读和视听词识别的深度学习架构,其结合了配备时空输入层的残差网络(Residual Networks)与双向 LSTMs。该唇读架构在具有挑战性的 Lipreading-In-The-Wild 数据库上达到了 11.92% 的误分类率,该数据库由 BBC-TV 的片段组成,每个片段包含 500 个目标词之一。视听实验采用中间融合与后期融合,以及若干类型和等级的环境噪声进行,并报告了相对于纯音频网络的显著改进,即使在干净语音情况下亦然。进一步分析了目标词边界的效用,以及网络对目标词语语言境建模的能力。最后,我们考察了困难词对,并讨论了视觉信息如何有助于获得更高的识别精度。
引用
@article{arxiv.1811.01194,
title = {Pushing the boundaries of audiovisual word recognition using Residual Networks and LSTMs},
author = {Themos Stafylakis and Muhammad Haris Khan and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:1811.01194},
year = {2018}
}
备注
Accepted to Computer Vision and Image Understanding (Elsevier)