LOGO-Former:用于动态面部表情识别的局部—全局时空 Transformer
计算机视觉与模式识别
2023-05-08 v1 多媒体
摘要
以往野外动态面部表情识别(DFER)的方法主要基于卷积神经网络(CNNs),其局部操作忽略了视频中的长程依赖。基于 Transformer 的 DFER 方法可取得更好性能,但导致更高的 FLOPs 与计算成本。为解决这些问题,提出局部—全局时空 Transformer (LOGO-Former),以在平衡复杂度的同时捕获各帧内的判别性特征并建模帧间上下文关系。基于面部肌肉局部运动与面部表情渐变的先验,我们首先将空间注意力与时间注意力均限制于局部窗口,以捕获特征 token 间的局部交互。此外,我们通过以每一局部窗口的特征迭代查询一个 token 来执行全局注意力,从而获得整个视频序列的长程信息。另外,我们提出紧凑损失正则项以进一步促使所学特征具有最小类内距离与最大类间距离。在两个野外动态面部表情数据集(即 DFEW 与 FERV39K)上的实验表明,我们的方法为利用时空依赖进行 DFER 提供了有效途径。
引用
@article{arxiv.2305.03343,
title = {LOGO-Former: Local-Global Spatio-Temporal Transformer for Dynamic Facial Expression Recognition},
author = {Fuyan Ma and Bin Sun and Shutao Li},
journal= {arXiv preprint arXiv:2305.03343},
year = {2023}
}
备注
Accepted by ICASSP2023. arXiv admin note: substantial text overlap with arXiv:2205.04749