基于图卷积网络的视频人脸表情识别
计算机视觉与模式识别
2020-10-27 v1
摘要
人脸表情识别(FER)旨在对面部图像或视频中存在的表情进行分类,已在人工智能与多媒体领域引起大量研究兴趣。针对基于视频的 FER 任务,捕捉帧间的动态表情变化以识别面部表情是合理的。然而,现有方法直接利用 CNN-RNN 或 3D CNN 从不同面部单元提取时空特征,而非在捕捉表情变化时聚焦于特定区域,导致 FER 性能受限。本文中,我们将图卷积网络(GCN)层引入常见的基于 CNN-RNN 的模型用于基于视频的 FER。首先,GCN 层用于在节点间共享提取的 CNN 特征信息后,学习聚焦于特定区域的更显著面部表情特征。随后,应用 LSTM 层学习 GCN 所学特征间的长期依赖以建模变化。此外,还设计了一种权重分配机制,通过刻画每帧中的表情强度对不同节点输出加权以用于最终分类。据我们所知,这是首次在 FER 任务中使用 GCN。我们在三个广泛使用的数据集 CK+、Oulu-CASIA 和 MMI,以及一个具有挑战性的真实场景数据集 AFEW8.0 上评估了我们的方法,实验结果表明我们的方法优于现有方法。
引用
@article{arxiv.2010.13386,
title = {Video-based Facial Expression Recognition using Graph Convolutional Networks},
author = {Daizong Liu and Hongting Zhang and Pan Zhou},
journal= {arXiv preprint arXiv:2010.13386},
year = {2020}
}
备注
Accepted by ICPR2020