中文

用于视频中面部表情识别的帧注意力网络

计算机视觉与模式识别 2019-09-13 v2 人机交互 多媒体

摘要

基于视频的面部表情识别旨在将给定视频分类为若干基本情绪。如何整合各帧的面部特征对该任务至关重要。本文中,我们提出帧注意力网络(FAN),以端到端框架自动高亮若干具判别性的帧。该网络以包含可变数量人脸图像的视频作为输入,产生固定维度的表示。整个网络由两个模块组成:特征嵌入模块为深度卷积神经网络(CNN),将人脸图像嵌入为特征向量;帧注意力模块学习多个注意力权重,用于自适应聚合特征向量以形成单一的判别性视频表示。我们在 CK+ 与 AFEW8.0 数据集上进行了充分实验。我们提出的 FAN 相较其他基于 CNN 的方法表现出更优性能,并在 CK+ 上取得最先进(state-of-the-art)性能。

关键词

引用

@article{arxiv.1907.00193,
  title  = {Frame attention networks for facial expression recognition in videos},
  author = {Debin Meng and Xiaojiang Peng and Kai Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:1907.00193},
  year   = {2019}
}

备注

Accepted by ICIP 2019