图像中的人脸表情——2D人脸几何与3D人脸局部运动对比深度神经特征
计算机视觉与模式识别
2019-02-01 v1
摘要
在使用CNN/MMOD人脸检测器的网络摄像头场景下,我们比较了几种用于识别可见人类情绪的计算机算法。识别涉及四种面部表情:微笑、惊讶、愤怒和中性。在特征提取阶段,对比以下三种人脸描述概念:(a) 由其68个特征关键点(FP68)表示的静态2D人脸几何;(b) 由个性化Candide-3模型的八个区分性面部部位(记为AU8)的运动参数定义的动态3D几何;(c) 作为灰度像素2D阵列的静态2D视觉描述(即人脸原始图像)。在分类阶段,分析了两类主要模型的性能:(a) 带核选项的支持向量机(SVM);(b) 带有多种相关张量处理层及其块的卷积神经网络(CNN)。模型针对人脸正面视图训练,而在任意头部姿态下测试。对于几何特征,成功率(准确率)表明CNN相对于SVM分类器的性能提升近三倍。对于原始图像,CNN的准确率优于其最佳几何对应项(AU/CNN)约30%,而最佳SVM方案则劣近四倍。对于F值,同样观察到原始/CNN相对于几何/CNN和几何/SVM的显著优势。我们得出结论:与基于CNN的情绪分类器相反,基于SVM的情绪分类器在人脸头部姿态方面的泛化能力较差。
引用
@article{arxiv.1901.11179,
title = {Human Face Expressions from Images - 2D Face Geometry and 3D Face Local Motion versus Deep Neural Features},
author = {Rafal Pilarczyk and Xin Chang and Wladyslaw Skarbek},
journal= {arXiv preprint arXiv:1901.11179},
year = {2019}
}