面向人脸表情和口罩佩戴分类的跨任务多分支视觉Transformer
计算机视觉与模式识别
2024-05-01 v2 人工智能
摘要
随着口罩佩戴成为新的文化规范,考虑口罩的面部表情识别(FER)已成为一个重要挑战。本文提出了一种用于面部表情识别和口罩佩戴分类任务的统一多分支视觉Transformer。我们的方法通过双分支架构提取两项任务的共享特征,获得多尺度特征表示。此外,我们提出了跨任务融合阶段,对每个任务的 token 使用独立分支处理,同时通过跨注意力模块交换信息。我们的方法通过简单而有效的跨任务融合阶段,减少了与为两项任务分别使用独立网络相比的总体复杂度。广泛的实验表明,我们提出的模型在面部表情识别和面部口罩佩戴分类任务上表现出色,甚至与不同最先进的方法相当。
引用
@article{arxiv.2404.14606,
title = {Cross-Task Multi-Branch Vision Transformer for Facial Expression and Mask Wearing Classification},
author = {Armando Zhu and Keqin Li and Tong Wu and Peng Zhao and Bo Hong},
journal= {arXiv preprint arXiv:2404.14606},
year = {2024}
}