基于 Transformer 的多尺度多模态微表情识别算法
计算机视觉与模式识别
2023-01-12 v2 人工智能
摘要
微表情是一种自发的无意识面部肌肉运动,能够揭示人们试图隐藏的真实情绪。尽管手工方法已取得良好进展,且深度学习日益受到重视,但由于微表情持续时间短且在不同面部区域表现出的尺度各异,现有算法无法在兼顾上下文信息以学习潜在特征的同时提取多模态多尺度面部区域特征。因此,为解决上述问题,本文提出一种基于 Transformer 网络的多模态多尺度算法,旨在通过微表情的两种模态特征——运动特征与纹理特征——充分学习微表情的局部多粒度特征。为获取面部在不同尺度下的局部区域特征,我们对两种模态均学习了不同尺度的图像块(patch)特征,随后融合多层多头注意力权重以通过对 patch 特征加权获得有效特征,并结合跨模态对比学习进行模型优化。我们在三个自发数据集上进行了综合实验,结果表明所提算法在单一测试的 SMIC 数据库上准确率高达 78.73%,在联合数据库的 CASMEII 上 F1 值高达 0.9071,处于领先水平。
引用
@article{arxiv.2301.02969,
title = {Multi-scale multi-modal micro-expression recognition algorithm based on transformer},
author = {Fengping Wang and Jie Li and Chun Qi and Lin Wang and Pan Wang},
journal= {arXiv preprint arXiv:2301.02969},
year = {2023}
}