MFEViT:一种用于多模态2D+3D面部表情识别的鲁棒轻量级Transformer网络
计算机视觉与模式识别
2021-09-28 v1 人工智能
摘要
视觉Transformer(ViT)因其自注意力机制能够从第一层起获取全局感受野,已被广泛应用于诸多领域,并在某些视觉任务中取得了超越CNN的惊人性能。然而,将视觉Transformer应用于2D+3D面部表情识别(FER)时存在一个问题,即ViT训练需要大量数据。尽管如此,公开2D+3D FER数据集中的样本数量远不足以用于评估。如何利用在RGB图像上预训练的ViT来处理2D+3D数据成为一个挑战。为解决该问题,我们提出了一种用于多模态2D+3D FER的鲁棒轻量级纯Transformer网络,即MFEViT。为缩小RGB与多模态数据之间的差距,我们设计了一种交替融合策略,将RGB图像的三个通道分别替换为深度图通道,并在输入Transformer编码器之前进行融合。此外,所设计的样本过滤模块为每个表情增加若干子类,并将噪声样本移至其对应子类,从而在训练阶段消除其对网络的干扰。大量实验表明,我们的MFEViT在BU-3DFE上以90.83%的准确率、在Bosphorus上以90.28%的准确率优于当前最优方法。具体而言,所提出的MFEViT是一个轻量级模型,所需参数量远少于多分支CNN。据我们所知,这是首项将视觉Transformer引入多模态2D+3D FER的工作。我们的MFEViT源代码将公开可用。
引用
@article{arxiv.2109.13086,
title = {MFEViT: A Robust Lightweight Transformer-based Network for Multimodal 2D+3D Facial Expression Recognition},
author = {Hanting Li and Mingzhe Sui and Zhaoqing Zhu and Feng Zhao},
journal= {arXiv preprint arXiv:2109.13086},
year = {2021}
}
备注
9pages,6 figures,5 tables