用于野外动态面部表情识别的时空Transformer
计算机视觉与模式识别
2022-05-11 v1 多媒体
摘要
以往用于野外动态面部表情识别的方法主要基于卷积神经网络(CNNs),其局部操作忽略了视频中的长程依赖。为解决该问题,我们提出时空Transformer(STT)以捕获各帧内的判别性特征并建模帧间上下文关系。我们的统一Transformer捕获并整合时空依赖。具体而言,给定由多帧组成的图像序列作为输入,我们利用CNN骨干网络将每帧转换为视觉特征序列。随后,在每个块内联合应用空间注意力与时间注意力,用于在序列层级学习时空表示。此外,我们提出紧凑softmax交叉熵损失以进一步促使所学特征具有最小类内距离和最大类间距离。在两个野外动态面部表情数据集(即DFEW和AFEW)上的实验表明,我们的方法为利用时空依赖进行动态面部表情识别提供了有效途径。源代码与训练日志将公开提供。
引用
@article{arxiv.2205.04749,
title = {Spatio-Temporal Transformer for Dynamic Facial Expression Recognition in the Wild},
author = {Fuyan Ma and Bin Sun and Shutao Li},
journal= {arXiv preprint arXiv:2205.04749},
year = {2022}
}