我们能否读唇之外的言语?重新思考深度视觉语音识别中的感兴趣区域选择
计算机视觉与模式识别
2020-03-10 v2
摘要
深度学习的近期进展提升了研究人员在视觉语音识别(VSR)领域的兴趣。当前,大多数现有方法将VSR等同于自动读唇,试图通过分析嘴唇运动来识别语音。然而,人类经验与心理学研究表明,在面对面交谈时我们并非总是注视彼此的嘴唇,而是反复扫描整张脸。这启发我们重新审视一个根本却某种程度上被忽视的问题:VSR模型能否从读取口外面部区域(即嘴唇之外)获益?在本文中,我们使用最先进的VSR模型(包括嘴部、整张脸、上半脸乃至脸颊)对不同面部区域的效果进行了全面研究。实验在具有不同特征的词级和句级基准上开展。我们发现,尽管数据存在复杂变化,融入口外面部区域(甚至上半脸)的信息始终有益于VSR性能。此外,我们引入了一种基于Cutout的简单而有效的方法,以学习更具判别力的特征用于基于人脸的VSR,期望最大化编码于不同面部区域中的信息效用。我们的实验显示出相对于现有仅以唇部区域作为输入的最先进方法的明显改进,我们相信这一结果可能为VSR领域提供一些新颖而令人振奋的见解。
引用
@article{arxiv.2003.03206,
title = {Can We Read Speech Beyond the Lips? Rethinking RoI Selection for Deep Visual Speech Recognition},
author = {Yuanhang Zhang and Shuang Yang and Jingyun Xiao and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2003.03206},
year = {2020}
}
备注
8 pages; accepted in the 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020)