AFNet-M:用于2D+3D面部表情识别的带掩码自适应融合网络
计算机视觉与模式识别
2022-05-25 v1 人工智能
摘要
2D+3D面部表情识别(FER)通过同时融合2D纹理与更鲁棒的3D深度信息,可有效应对光照变化与姿态变化。多数基于深度学习的方法采用简单融合策略,在全连接层后直接拼接多模态特征,未考虑各模态重要程度的不同。同时,如何聚焦于显著区域中的2D与3D局部特征仍是一大挑战。在本文中,我们提出用于2D+3D FER的带掩码自适应融合网络(AFNet-M)。为增强2D与3D局部特征,我们将标注面部显著区域的掩码作为先验知识,设计掩码注意力模块(MA),其可自动学习两个调制向量以调整特征图。此外,我们引入一种新颖融合策略,通过所设计的重要性权重计算模块(IWC)在卷积层进行自适应融合。实验结果表明,我们的AFNet-M在BU-3DFE与Bosphorus数据集上取得最先进性能,且相较其他模型所需参数更少。
引用
@article{arxiv.2205.11785,
title = {AFNet-M: Adaptive Fusion Network with Masks for 2D+3D Facial Expression Recognition},
author = {Mingzhe Sui and Hanting Li and Zhaoqing Zhu and Feng Zhao},
journal= {arXiv preprint arXiv:2205.11785},
year = {2022}
}
备注
6 pages, 6 figures, 4 tables