中文

SpotFormer:用于面部表情检测的多尺度时空Transformer

计算机视觉与模式识别 2026-04-14 v3

摘要

面部表情检测,即识别视频中出现面部表情的时间段,是面部表情分析中一项重要但具有挑战性的任务。无关面部运动的问题以及检测微表情中细微运动的挑战仍未解决,阻碍了准确的表情检测。在本文中,我们提出了一个高效的面部表情检测框架。首先,我们提出了一种紧凑滑动窗口多时间分辨率光流(CSW-MRO)特征,该特征在紧凑滑动窗口内计算输入图像序列的多时间分辨率光流。窗口长度经过定制,以感知完整的微表情并区分一般的宏表情和微表情。CSW-MRO可以有效地揭示细微运动,同时避免光流被头部运动主导。其次,我们提出了SpotFormer,这是一个多尺度时空Transformer,它同时编码CSW-MRO特征的时空关系,以进行精确的帧级概率估计。在SpotFormer中,我们使用提出的面部局部图池化(FLGP)操作和卷积层来提取多尺度时空特征。我们通过将SpotFormer与几个模型变体进行比较,展示了其架构的有效性。第三,我们将监督对比学习引入SpotFormer,以增强不同类型表情之间的可区分性。在SAMM-LV、CAS(ME)^2和CAS(ME)^3上的大量实验表明,我们的方法优于最先进的模型,特别是在微表情检测方面。代码可在https://github.com/KinopioIsAllIn/SpotFormer获取。

关键词

引用

@article{arxiv.2407.20799,
  title  = {SpotFormer: Multi-Scale Spatio-Temporal Transformer for Facial Expression Spotting},
  author = {Yicheng Deng and Hideaki Hayashi and Hajime Nagahara},
  journal= {arXiv preprint arXiv:2407.20799},
  year   = {2026}
}

备注

Accepted by IEEE Transactions on Affective Computing