SwinFace:一种用于人脸识别、表情识别、年龄估计与属性估计的多任务 Transformer
计算机视觉与模式识别
2023-08-23 v1
摘要
近年来,视觉 Transformer 被引入人脸识别与分析并实现了性能突破。然而,多数先前方法通常训练单个模型或模型集成来执行所需任务,忽略了不同任务间的协同作用,未能实现预测精度提升、数据效率提高与训练时间减少。本文提出一种基于单一 Swin Transformer 的通用算法,可同时完成人脸识别、面部表情识别、年龄估计与人脸属性估计(含性别等 40 个属性)。我们的设计 SwinFace 由单一共享主干与针对每组相关任务的子网络构成。为解决多任务间冲突并满足任务差异化需求,每个任务专用分析子网络集成了多级通道注意力(MLCA)模块,可自适应选择最优层级与通道的特征来执行所需任务。大量实验表明,所提模型对人脸具有更好理解,并在所有任务上取得优异性能。特别地,其在 RAF-DB 上达到 90.97% 准确率,在 CLAP2015 上达到 0.22 -error,分别为面部表情识别与年龄估计的当前最优结果。代码与模型将公开于 https://github.com/lxq1000/SwinFace。
引用
@article{arxiv.2308.11509,
title = {SwinFace: A Multi-task Transformer for Face Recognition, Expression Recognition, Age Estimation and Attribute Estimation},
author = {Lixiong Qin and Mei Wang and Chao Deng and Ke Wang and Xi Chen and Jiani Hu and Weihong Deng},
journal= {arXiv preprint arXiv:2308.11509},
year = {2023}
}