中文

FaceLiVTv2:面向高效移动人脸识别的改进型混合架构

计算机视觉与模式识别 2026-05-07 v1

摘要

轻量化人脸识别在边缘和移动设备上日益重要,必须在严格的延迟、内存和能耗约束下实现可靠的准确率。尽管近期的混合 CNN-Transformer 架构在全局上下文建模方面取得了进展,但在识别性能和计算效率之间取得有效的平衡仍是一个开放的挑战。本文我们提出 FaceLiVTv2,这是我们FaceLiVT混合架构的一个改进版本,旨在移动人脸识别中实现高效的全局-局部特征交互。其核心是 Lite MHLA,即一种轻量级全局 token 交互模块,将原有的多层注意力设计替换为多头线性 token 投影和仿射比例变换,在保持跨头表征多样性的同时减少冗余。我们进一步将 Lite MHLA 集成到统一的 RepMix 模块中,用于协调局部和全局特征交互,并在嵌入阶段采用全局深度可分离卷积实现自适应空间聚合。在我们的实验设置下,FaceLiVTv2 在 LFW、CA-LFW、CP-LFW、CFP-FP、AgeDB-30 和 IJB 上的结果表明,FaceLiVTv2 在现有轻量方法的准确率-效率权衡上持续取得改进。值得注意的是,FaceLiVTv2 相对于 FaceLiVTv1 减少了 22% 的移动推理延迟,在移动设备上相对于 GhostFaceNets 实现了最高 30.8% 的加速,在保持更高人脸识别准确率的同时,相对于 EdgeFace 和 KANFace 在各平台实现了 20-41% 的延迟改进。这些结果表明,FaceLiVTv2 提供了一个可用于实时人脸识别的实用且可部署的解决方案。代码已公开 https://github.com/novendrastywn/FaceLiVT。

关键词

引用

@article{arxiv.2604.09127,
  title  = {FaceLiVTv2: An Improved Hybrid Architecture for Efficient Mobile Face Recognition},
  author = {Novendra Setyawan and Chi-Chia Sun and Mao-Hsiu Hsu and Wen-Kai Kuo and Jun-Wei Hsieh},
  journal= {arXiv preprint arXiv:2604.09127},
  year   = {2026}
}