EPIR:面向微表情识别的高效补丁分词、集成与表示框架
计算机视觉与模式识别
2026-04-10 v1
摘要
微表情识别可以获取个体当下的真实情绪。尽管深度学习方法,特别是基于Transformer的方法,已取得令人瞩目的成绩,但这些方法由于多头自注意力中token的数量大,导致计算复杂度高。此外,现有的微表情数据集规模较小,这使得基于Transformer的模型难以学习有效的微表情表示。因此,我们提出一种 novel的高效补丁分词、集成与表示框架(EPIR),可以在高识别性能和低计算复杂度之间取得平衡。具体而言,我们首先提出了双范数位移分词(DNSPT)模块,通过精细的空间变换和双范数投影来学习面部区域中相邻像素之间的空间关系。随后,我们提出了token集成模块,用于在多个级联Transformer块之间整合部分token,从而在不损失信息的前提下减少token的数量。进一步,我们设计了一个判别性token提取器,首先改进Transformer块中的注意力,以减少对自token不必要的关注,并使用动态token选择模块(DTSM)选择关键token,从而捕获更具辨识力的微表情表示。我们在四个流行的公开数据集上进行了广泛实验(即CASME II、SAMM、SMIC和CAS(ME)3)。实验结果表明,我们的方法在基于UF1的CAS(ME)数据集上实现了显著的性能提升(提升9.6%),在基于UAR指标的SMIC数据集上实现了4.58%的提升。
引用
@article{arxiv.2604.08106,
title = {EPIR: An Efficient Patch Tokenization, Integration and Representation Framework for Micro-expression Recognition},
author = {Junbo Wang and Liangyu Fu and Yuke Li and Yining Zhu and Xuecheng Wu and Kun Hu},
journal= {arXiv preprint arXiv:2604.08106},
year = {2026}
}