中文

基于多尺度特征融合的轻量级注意力深度网络用于多视角面部表情识别

计算机视觉与模式识别 2025-02-11 v2

摘要

卷积神经网络(CNN)及其变体已在面部表情识别(FER)中展现出有效性。然而,它们在处理现实场景中的高计算复杂度和多视角头部姿态时面临挑战。我们引入了一种融合多尺度特征的轻量级注意力网络(LANMSFF)来解决这些问题。针对第一个挑战,我们精心设计了一个轻量级网络。我们通过提出两个新颖组件,即群体注意力(MassAtt)模块和逐点特征选择(PWFS)模块,来解决第二个挑战。MassAtt 模块同时生成通道和空间注意力图,通过强调重要特征并抑制不相关特征来重新校准特征图。此外,PWFS 模块采用了一种特征选择机制,在融合过程之前丢弃意义较小的特征。这一机制使其区别于以往直接融合多尺度特征的方法。我们提出的方法在参数量和姿态变化鲁棒性方面取得了与最先进方法相当的结果,在 KDEF、FER-2013 和 FERPlus 数据集上的准确率分别达到 90.77%、70.44% 和 86.96%。LANMSFF 的代码可在 https://github.com/AE-1129/LANMSFF 获取。

关键词

引用

@article{arxiv.2403.14318,
  title  = {A Lightweight Attention-based Deep Network via Multi-Scale Feature Fusion for Multi-View Facial Expression Recognition},
  author = {Ali Ezati and Mohammadreza Dezyani and Rajib Rana and Roozbeh Rajabi and Ahmad Ayatollahi},
  journal= {arXiv preprint arXiv:2403.14318},
  year   = {2025}
}

备注

10 pages, two-column, submitted to journal