中文

FER-YOLO-Mamba:基于选择性状态空间的面部表情检测与分类

计算机视觉与模式识别 2024-05-13 v3

摘要

面部表情识别(FER)在理解人类情感线索方面发挥着关键作用。然而,基于视觉信息的传统FER方法存在局限性,如预处理、特征提取和多阶段分类流程。这些不仅增加了计算复杂度,也需要大量计算资源。鉴于基于卷积神经网络(CNN)的FER方案在识别面部表情图像中嵌入的深层、远程依赖关系方面常不够充分,而Transformer内在的二次计算复杂度也限制了其应用,本文提出了FER-YOLO-Mamba模型,将Mamba和YOLO技术的原理融合以促进面部表情图像识别与定位之间的高效协调。在FER-YOLO-Mamba模型中,我们进一步设计了FER-YOLO-VSS双分支模块,将卷积层在局部特征提取方面的固有优势与状态空间模型(SSM)在揭示远程依赖关系方面的卓越能力相结合。迄今为止,这是首个专为面部表情检测和分类设计的视觉Mamba模型。为评估所提出的FER-YOLO-Mamba模型性能,我们在两个基准数据集上进行了实验,即RAF-DB和SFEW。实验结果表明,FER-YOLO-Mamba模型在其他模型之上取得了更好的成绩。该代码可从 https://github.com/SwjtuMa/FER-YOLO-Mamba 获取。

关键词

引用

@article{arxiv.2405.01828,
  title  = {FER-YOLO-Mamba: Facial Expression Detection and Classification Based on Selective State Space},
  author = {Hui Ma and Sen Lei and Turgay Celik and Heng-Chao Li},
  journal= {arXiv preprint arXiv:2405.01828},
  year   = {2024}
}