中文

基于Vision Transformer和重叠补丁的改进耳部验证

计算机视觉与模式识别 2025-04-01 v1 人工智能

摘要

耳部识别因其在成年后外观稳定性而成为一种有前景的生物识别模态。尽管Vision Transformer(ViT)在图像识别任务中被广泛使用,但其在耳部识别中的效率受到因忽视重叠补丁而受限,这对于捕捉细微的耳部特征至关重要。本研究在多样化的数据集(OPIB、AWE、WPUT和EarVN1.0)上评估了ViT-Tiny(ViT-T)、ViT-Small(ViT-S)、ViT-Base(ViT-B)和ViT-Large(ViT-L)配置,采用重叠补丁选择策略。结果表明,重叠补丁的重要性至关重要,在结构化研究中48项实验中44项均取得优异成绩。此外,与非重叠配置相比,重叠补丁的性能提升显著,最高可达10%,适用于EarVN1.0数据集。在模型性能方面,ViT-T模型在AWE、WPUT和EarVN1.0数据集上 consistently 优于ViT-S、ViT-B和ViT-L模型。最高得分以补丁大小为28x28、步幅为14像素的配置实现,该补丁-步幅配置代表归一化图像面积(112x112像素)的25%,以及行或列大小的12.5%。本研究确认,具有重叠补丁选择策略的转换器架构可作为耳部生物识别验证场景中的一种高效且高性能选项。

关键词

引用

@article{arxiv.2503.23275,
  title  = {Improved Ear Verification with Vision Transformers and Overlapping Patches},
  author = {Deeksha Arun and Kagan Ozturk and Kevin W. Bowyer and Patrick Flynn},
  journal= {arXiv preprint arXiv:2503.23275},
  year   = {2025}
}