基于 Vision Transformer 的部件级人脸识别
计算机视觉与模式识别
2022-12-02 v1 人工智能
摘要
使用 CNN 和基于间隔损失的整体方法一直主导着人脸识别的研究。在本工作中,我们从两个方面偏离了这一设定:(a) 我们采用 Vision Transformer 作为架构来训练一个非常强的人脸识别基线,简称为 fViT,它已经超越了大多数 state-of-the-art 的人脸识别方法。(b) 其次,我们利用 Transformer 处理从不规则网格中提取的信息(视觉 token)的固有特性,设计了一个类似于部件级人脸识别方法的人脸识别流水线。我们的流水线称为 part fViT,仅包含一个预测面部关键点坐标的轻量级网络,随后是在从预测关键点提取的图块上运行的 Vision Transformer,并且它在没有关键点监督的情况下进行端到端训练。通过学习提取具有判别性的图块,我们基于部件的 Transformer 进一步提升了 Vision Transformer 基线的准确率,在多个人脸识别基准上达到了 state-of-the-art 的准确率。
引用
@article{arxiv.2212.00057,
title = {Part-based Face Recognition with Vision Transformers},
author = {Zhonglin Sun and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2212.00057},
year = {2022}
}
备注
Accepted to BMVC 2022