中文

FaceXFormer:用于面部分析的统一 Transformer

计算机视觉与模式识别 2025-03-11 v3

摘要

在这项工作中,我们引入了 FaceXFormer,这是一种端到端的统一 Transformer 模型,能够在单一框架内执行十项面部分析任务。这些任务包括人脸解析、关键点检测、头部姿态估计、属性预测、年龄、性别和种族估计、面部表情识别、人脸识别和人脸可见性。传统的面部分析方法依赖于特定任务的架构和预处理技术,限制了可扩展性和集成性。相比之下,FaceXFormer 采用基于 Transformer 的编码器-解码器架构,其中每个任务被表示为一个可学习的 token,从而能够在统一模型内进行无缝的多任务处理。为了提高效率,我们引入了 FaceX,这是一个具有新颖双向交叉注意力机制的轻量级解码器,它联合处理人脸 token 和任务 token,以学习鲁棒且泛化的人脸表示。我们在十个人脸感知数据集上训练 FaceXFormer,并在多个基准上针对专用模型和多任务模型对其进行评估,展示了 SOTA 或具有竞争力的性能。此外,我们分析了 FaceXFormer 各组件对性能的影响,评估了在“in-the-wild”环境下的真实世界鲁棒性,并进行了计算性能评估。据我们所知,FaceXFormer 是第一个能够处理十项面部分析任务同时保持 33.21 FPS 实时性能的模型。代码:https://github.com/Kartik-3004/facexformer

关键词

引用

@article{arxiv.2403.12960,
  title  = {FaceXFormer: A Unified Transformer for Facial Analysis},
  author = {Kartik Narayan and Vibashan VS and Rama Chellappa and Vishal M. Patel},
  journal= {arXiv preprint arXiv:2403.12960},
  year   = {2025}
}

备注

Project page: https://kartik-3004.github.io/facexformer/