SpotFormer:用于面部表情检测的多尺度时空Transformer
计算机视觉与模式识别
2026-04-14 v3
摘要
面部表情检测,即识别视频中出现面部表情的时间段,是面部表情分析中一项重要但具有挑战性的任务。无关面部运动的问题以及检测微表情中细微运动的挑战仍未解决,阻碍了准确的表情检测。在本文中,我们提出了一个高效的面部表情检测框架。首先,我们提出了一种紧凑滑动窗口多时间分辨率光流(CSW-MRO)特征,该特征在紧凑滑动窗口内计算输入图像序列的多时间分辨率光流。窗口长度经过定制,以感知完整的微表情并区分一般的宏表情和微表情。CSW-MRO可以有效地揭示细微运动,同时避免光流被头部运动主导。其次,我们提出了SpotFormer,这是一个多尺度时空Transformer,它同时编码CSW-MRO特征的时空关系,以进行精确的帧级概率估计。在SpotFormer中,我们使用提出的面部局部图池化(FLGP)操作和卷积层来提取多尺度时空特征。我们通过将SpotFormer与几个模型变体进行比较,展示了其架构的有效性。第三,我们将监督对比学习引入SpotFormer,以增强不同类型表情之间的可区分性。在SAMM-LV、CAS(ME)^2和CAS(ME)^3上的大量实验表明,我们的方法优于最先进的模型,特别是在微表情检测方面。代码可在https://github.com/KinopioIsAllIn/SpotFormer获取。
引用
@article{arxiv.2407.20799,
title = {SpotFormer: Multi-Scale Spatio-Temporal Transformer for Facial Expression Spotting},
author = {Yicheng Deng and Hideaki Hayashi and Hajime Nagahara},
journal= {arXiv preprint arXiv:2407.20799},
year = {2026}
}
备注
Accepted by IEEE Transactions on Affective Computing