中文

多尺度时空图卷积网络用于面部表情定位

计算机视觉与模式识别 2024-03-26 v1 人工智能

摘要

面部表情定位是面部表情分析中一项重要但具有挑战性的任务。表情定位的准确性不仅受到无关面部运动的影响,还受到微表情中细微运动感知困难的影响。在本文中,我们提出了一种多尺度时空图卷积网络(SpoT-GCN)用于面部表情定位。为了提取更鲁棒的运动特征,我们在紧凑滑动窗口中跟踪面部肌肉的短期和长期运动,滑动窗口的长度自适应于网络的时间感受野。这种策略称为感受野自适应滑动窗口策略,有效放大了运动特征,同时缓解了严重头部运动的问题。然后将细微运动特征转换为面部图表示,其时空图模式由图卷积网络学习。该网络使用我们提出的面部局部图池化(FLGP)从多尺度面部图结构中学习局部和全局特征。此外,我们引入监督对比学习以增强模型对难以分类帧的判别能力。在SAMM-LV和CAS(ME)^2数据集上的实验结果表明,我们的方法达到了最先进的性能,特别是在微表情定位方面。消融研究进一步验证了我们提出的模块的有效性。

关键词

引用

@article{arxiv.2403.15994,
  title  = {Multi-Scale Spatio-Temporal Graph Convolutional Network for Facial Expression Spotting},
  author = {Yicheng Deng and Hideaki Hayashi and Hajime Nagahara},
  journal= {arXiv preprint arXiv:2403.15994},
  year   = {2024}
}

备注

Accepted by FG2024