FaceLiVT:面向移动设备的线性视觉Transformer结构重参数化人脸识别
计算机视觉与模式识别
2025-12-08 v1
摘要
本文提出 FaceLiVT,一种轻量且强大的人脸识别模型,它融合了混合卷积神经网络(CNN)-Transformer 架构与创新的轻量多头线性注意力(MHLA)机制。通过结合 MHLA 与重参数化令牌混合器,FaceLiVT 在保持竞争力的准确率的同时有效降低了计算复杂度。在 LFW、CFP-FP、AgeDB-30、IJG-B 和 IJB-C 等具有挑战性的基准数据集上的广泛评估,凸显了其相比现有最先进轻量模型的优越性能。MHLA 显著提升了推理速度,使 FaceLiVT 能够在移动设备上以较低延迟实现高精度识别。具体而言,FaceLiVT 比 EdgeFace(一种面向边缘设备优化的最新混合 CNN-Transformer 模型)快 8.6 倍,比纯 ViT 模型快 21.2 倍。凭借其均衡的设计,FaceLiVT 为资源受限平台上的实时人脸识别提供了一种高效且实用的解决方案。
引用
@article{arxiv.2506.10361,
title = {FaceLiVT: Face Recognition using Linear Vision Transformer with Structural Reparameterization For Mobile Device},
author = {Novendra Setyawan and Chi-Chia Sun and Mao-Hsiu Hsu and Wen-Kai Kuo and Jun-Wei Hsieh},
journal= {arXiv preprint arXiv:2506.10361},
year = {2025}
}
备注
2025 ICIP