用于微表情识别的 HTNet
计算机视觉与模式识别
2023-07-28 v1
摘要
面部表情与面部肌肉收缩相关,不同的肌肉运动对应不同的情绪状态。对于微表情识别,肌肉运动通常很细微,这对当前面部情绪识别算法的性能有负面影响。大多数现有方法使用自注意力机制来捕获序列中 token 间的关系,但未考虑面部 landmarks 间固有的空间关系。这会导致微表情识别任务上的次优性能。因此,学习识别面部肌肉运动是微表情识别领域的关键挑战。在本文中,我们提出一种分层 Transformer 网络(HTNet)来识别面部肌肉运动的关键区域。HTNet 包括两个主要组件:利用局部时间特征的 transformer 层,以及提取局部与全局语义面部特征的聚合层。具体而言,HTNet 将脸部分为四个不同面部区域:左唇区、左眼区、右眼区和右唇区。transformer 层用于通过各区域内的局部自注意力来聚焦表示局部微小肌肉运动。聚合层用于学习眼区与唇区之间的交互。在四个公开可用微表情数据集上的实验表明,所提方法大幅优于先前方法。代码与模型可见于:\url{https://github.com/wangzhifengharrison/HTNet}
引用
@article{arxiv.2307.14637,
title = {HTNet for micro-expression recognition},
author = {Zhifeng Wang and Kaihao Zhang and Wenhan Luo and Ramesh Sankaranarayana},
journal= {arXiv preprint arXiv:2307.14637},
year = {2023}
}
备注
35 pages, 7 figures