中文

MSSTNet:一种用于动态面部表情识别的多尺度时空 CNN-Transformer 网络

计算机视觉与模式识别 2024-04-15 v1

摘要

与典型的视频动作识别不同,动态面部表情识别(DFER)不涉及明显的运动目标,而是依赖于面部肌肉的局部变化。针对这一独特属性,我们提出了一种多尺度时空 CNN-Transformer 网络(MSSTNet)。我们的方法提取由 CNN 提取的不同尺度空间特征,并将其输入到多尺度嵌入层(MELayer)中。MELayer 提取多尺度空间信息并对这些特征进行编码,然后将其送入时间 Transformer(T-Former)。T-Former 在提取时间信息的同时,持续整合多尺度空间信息。这一过程最终生成用于最终分类的多尺度时空特征。我们的方法在两个自然数据集上取得了 SOTA 结果。此外,一系列消融实验和可视化进一步验证了我们的方法在利用 DFER 时空信息方面的卓越能力。

关键词

引用

@article{arxiv.2404.08433,
  title  = {MSSTNet: A Multi-Scale Spatio-Temporal CNN-Transformer Network for Dynamic Facial Expression Recognition},
  author = {Linhuang Wang and Xin Kang and Fei Ding and Satoshi Nakagawa and Fuji Ren},
  journal= {arXiv preprint arXiv:2404.08433},
  year   = {2024}
}

备注

Accepted to 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2024)