中文

面向视频眼周区域识别的注意力感知 Transformer 聚合网络

计算机视觉与模式识别 2026-05-19 v1 机器学习

摘要

视频眼周区域识别是指基于个体眼部区域对个体身份进行识别的任务。眼周区域是人脸中最具辨识力的区域之一,适用于识别任务。由于在不受约束的获取条件下,面部或虹膜识别变得不可行,眼周区域作为生物识别模态的应用正日益增长,尤其在监视场景中。本文提出了一种面向监视环境的基于注意力机制的视频眼周区域识别方法。该框架包含两个主要模块:特征嵌入和特征聚合。特征嵌入模块是一个深度卷积神经网络,将眼周区域数据映射到特征向量。聚合模块是一个仅包含编码器的 Transformer,用于自适应学习将帧级特征聚合为单个视频表示及其对应的特征向量。在公开可用的 COX Face 数据集上进行实验,表明所提方法在鲁棒性上优于朴素的聚合方案。在最佳情况下,该方法在 99.8%99.8\% 的 TPR@1e11e^{-1}96.6%96.6\% 的 Rank-5 上取得优异成绩。

关键词

引用

@article{arxiv.2605.16550,
  title  = {Attention-Aware Transformer-Based Aggregation Network for Video Periocular Recognition},
  author = {Luiz G F Carreira and Breno A Mariano and Victor H C de Melo and David Menotti and William Robson Schwartz},
  journal= {arXiv preprint arXiv:2605.16550},
  year   = {2026}
}

备注

Accepted at ICIP 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses. DOI to be added upon publication