中文

用于鲁棒基于视频的人脸表情识别的表情片段Transformer

计算机视觉与模式识别 2021-09-20 v1

摘要

近期Transformer的成功为包括基于视频的人脸表情识别(FER)在内的多种视觉理解任务提供了新方向。通过有效建模视觉关系,Transformer已展现出刻画复杂模式的能力。然而,Transformer在察觉细微面部表情运动上仍表现不佳,因为许多视频的表情运动过小,难以提取有意义时空关系并实现鲁棒性能。为此,我们提出将每段视频分解为一系列表情片段,每个片段包含少量面部运动,并分别增强Transformer建模片段内与片段间视觉关系的能力,得到表情片段Transformer(EST)。具体地,对于片段内建模,我们设计了一种注意力增强的片段特征提取器(AA-SFE),通过逐步关注更显著信息来加强各片段细微面部运动的编码。此外,对于片段间建模,我们引入打乱片段顺序预测(SSOP)头及相应损失,通过训练Transformer识别打乱的片段顺序来改进对后续片段间细微运动变化的建模。在四个具挑战性数据集(即BU-3DFE、MMI、AFEW和DFEW)上的大量实验表明,我们的EST优于其他基于CNN的方法,取得了最先进的性能。

关键词

引用

@article{arxiv.2109.08409,
  title  = {Expression Snippet Transformer for Robust Video-based Facial Expression Recognition},
  author = {Yuanyuan Liu and Wenbin Wang and Chuanxu Feng and Haoyu Zhang and Zhe Chen and Yibing Zhan},
  journal= {arXiv preprint arXiv:2109.08409},
  year   = {2021}
}