面向姿态不变唇语识别
计算机视觉与模式识别
2019-11-15 v1
摘要
得益于强大的深度学习架构,唇语识别模型近期取得了显著改进。然而,大多数工作聚焦于嘴部正面或近正面视角。因此,在非正面嘴部视角下唇语识别性能严重退化。在本工作中,我们提出一种在合成数据上训练姿态不变唇语识别模型的框架,而非收集和标注成本高且繁琐的非正面数据。所提模型在非正面视角下显著优于以往方法,同时在正面和近正面嘴部视角下保持了优越性能。具体而言,我们提出使用三维可变形模型(3DMM)通过生成任意姿态下的合成人脸数据来增强 LRW——一个现有大规模但主要为正面的数据集。新得到的数据集用于训练最先进的唇语识别神经网络。我们在 LRS2 数据集上进行了孤立词识别的跨库实验,取得了 2.55% 的绝对提升。所提方法的优势在极端姿态下更为明显,相较基线实现了最高 20.64% 的绝对提升。
引用
@article{arxiv.1911.06095,
title = {Towards Pose-invariant Lip-Reading},
author = {Shiyang Cheng and Pingchuan Ma and Georgios Tzimiropoulos and Stavros Petridis and Adrian Bulat and Jie Shen and Maja Pantic},
journal= {arXiv preprint arXiv:1911.06095},
year = {2019}
}
备注
6 pages, 2 figures