中文

AHMSA-Net:用于微表情识别的自适应分层多尺度注意力网络

计算机视觉与模式识别 2025-01-07 v1

摘要

由于所涉及运动变化的瞬态和微妙特性,微表情识别(MER)面临重大挑战。近年来,基于注意力机制的深度学习方法在 MER 中取得了一些突破。然而,在应对微表情的瞬时微小运动变化时,这些方法仍存在特征捕获不足和动态适应性差的局限性。因此,本文设计了一种用于 MER 的自适应分层多尺度注意力网络(AHMSA-Net)。具体而言,我们首先利用微表情序列的起始帧和顶点帧提取三维(3D)光流图,包括水平光流、垂直光流和光流应变。随后,将光流特征图输入至 AHMSA-Net,该网络由两部分组成:自适应分层框架和多尺度注意力机制。基于自适应下采样分层注意力框架,AHMSA-Net 通过动态调整每一层光流特征图的大小,从不同粒度(精细和粗糙)捕获微表情的微小变化。基于多尺度注意力机制,AHMSA-Net 通过融合不同尺度(通道和空间)的特征来学习微表情动作信息。这两个模块协同工作,全面提高了 MER 的准确率。此外,严格的实验表明,所提出的方法在主要微表情数据库上取得了有竞争力的结果,AHMSA-Net 在复合数据库(SMIC、SAMM、CASMEII)上的识别准确率高达 78.21%,在 CASME^{}3 数据库上为 77.08%。

关键词

引用

@article{arxiv.2501.02539,
  title  = {AHMSA-Net: Adaptive Hierarchical Multi-Scale Attention Network for Micro-Expression Recognition},
  author = {Lijun Zhang and Yifan Zhang and Weicheng Tang and Xinzhi Sun and Xiaomeng Wang and Zhanshan Li},
  journal= {arXiv preprint arXiv:2501.02539},
  year   = {2025}
}