MOL:基于Transformer-图卷积的微表情、光流与 landmarks 联合估计
计算机视觉与模式识别
2025-06-18 v1
摘要
面部微表情识别(MER)是一项具有挑战性的任务,由于微表情(ME)动作瞬时且细微。目前大多数方法依赖手工特征、关键帧(如起始帧、顶峰帧和结束帧),或受限于小规模和数据样本性差的数据集的深度网络。在本文中,我们提出了一种基于Transformer、图卷积和普通卷积优势的端到端微动作感知深度学习框架。具体而言,我们提出了一种新颖的F5C模块,由全连接卷积和通道对应卷积组成,用于直接从原始帧序列中提取局部-全局特征,无需关键帧的先验知识。所提出的Transformer风格的全连接卷积用于提取局部特征,同时保持全局感受野;图风格的通道对应卷积用于建模特征模式之间的相关性。此外,联合训练微表情识别、光流估计和面部 landmarks 检测,通过共享局部-全局特征。后两者有助于捕捉面部细微动作信息用于MER,从而可减轻训练数据不足的影响。大量实验表明,我们的框架(i)在CASME II、SAMM和SMIC基准测试中超越了最新的微表情识别方法,(ii)在光流估计和面部 landmarks 检测方面表现良好,(iii)能够捕捉与微表情相关的面部细微肌肉动作。代码已公开于 https://github.com/CYF-cuber/MOL。
引用
@article{arxiv.2506.14511,
title = {MOL: Joint Estimation of Micro-Expression, Optical Flow, and Landmark via Transformer-Graph-Style Convolution},
author = {Zhiwen Shao and Yifan Cheng and Feiran Li and Yong Zhou and Xuequan Lu and Yuan Xie and Lizhuang Ma},
journal= {arXiv preprint arXiv:2506.14511},
year = {2025}
}
备注
This paper has been accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence