中文

基于视觉 Transformer 的分布式外数据快速可解释人脸辨识

计算机视觉与模式识别 2023-11-07 v1

摘要

大多数人脸辨识方法采用孪生神经网络在图像嵌入层面比较两幅图像。然而,该技术可能受遮挡(如戴口罩或墨镜的人脸)与分布外数据的影响。DeepFace-EMD(Phan 等,2022)通过在图像层面比较两幅图像、再在块层面比较,在分布外数据上达到了最先进的准确率。然而,其后续的逐块重排序阶段由于最优传输优化而具有 O(n3logn)O(n^3 \log n) 的时间复杂度(对于图像中 nn 个块)。本文中,我们提出一种新颖的二图像视觉 Transformer(ViTs),利用交叉注意力在块层面比较两幅图像。在 CASIA Webface(Yi 等,2014)的 200 万对图像上训练后,我们的模型在分布外数据上取得了与 DeepFace-EMD 相当的准确率,而推理速度却比 DeepFace-EMD(Phan 等,2022)快一倍以上。此外,通过一项人类研究,我们的模型借助交叉注意力的可视化展现出良好的可解释性。我们相信本工作能启发更多关于使用 ViTs 进行人脸辨识的探索。

关键词

引用

@article{arxiv.2311.02803,
  title  = {Fast and Interpretable Face Identification for Out-Of-Distribution Data Using Vision Transformers},
  author = {Hai Phan and Cindy Le and Vu Le and Yihui He and Anh Totti Nguyen},
  journal= {arXiv preprint arXiv:2311.02803},
  year   = {2023}
}

备注

20 pages, 15 Figures