中文

基于 landmarks 感知与分块的集成迁移学习网络用于静态图像面部表情识别

计算机视觉与模式识别 2021-11-05 v2 机器学习 神经与进化计算 图像与视频处理

摘要

静态图像面部表情识别是计算机视觉应用中的一项挑战性问题。卷积神经网络(CNN)作为各类计算机视觉任务的最先进方法,在预测具有极端姿态、光照和遮挡条件的人脸表情方面成功有限。为缓解该问题,CNN常辅以迁移、多任务或集成学习等技术,这些技术往往以计算复杂度增加为代价提供高精度。本工作中,我们提出一种分块集成迁移学习网络,该网络通过关联面部特征的空间方向模式与特定表情来建模人类识别面部表情的方式。其由5个子网络构成,每个子网络从五组面部标志点(landmarks):眉毛、眼睛、鼻子、嘴巴或下颌之一向表情分类执行迁移学习。我们展示了所提集成网络利用源自面部肌肉运动运动的视觉模式来预测表情,并证明了从面部标志点定位到面部表情识别的迁移学习的效用。我们在CK+、JAFFE和SFEW数据集上测试了所提网络,其在CK+和JAFFE数据集上分别以0.51%和5.34%优于基准。此外,所提集成网络仅含1.65M模型参数,确保了训练与实时部署中的计算效率。我们集成网络的Grad-CAM可视化凸显了其子网络的互补性,这是有效集成网络的关键设计参数。最后,跨数据集评估结果揭示我们所提集成具有高泛化能力,使其适用于实际部署。

关键词

引用

@article{arxiv.2104.11274,
  title  = {Landmark-Aware and Part-based Ensemble Transfer Learning Network for Facial Expression Recognition from Static images},
  author = {Rohan Wadhawan and Tapan K. Gandhi},
  journal= {arXiv preprint arXiv:2104.11274},
  year   = {2021}
}