中文

IFViT:基于 Vision Transformer 的指纹匹配可解释定长表示

计算机视觉与模式识别 2024-04-15 v1 人工智能

摘要

确定指纹上用于构建深度定长表示以实现精确匹配的密集特征点,特别是在像素级别,具有重要意义。为了探索指纹匹配的可解释性,我们提出了一种多阶段可解释指纹匹配网络,即基于 Vision Transformer 的指纹匹配可解释定长表示(IFViT),该网络由两个主要模块组成。第一个模块是可解释密集配准模块,建立基于 Vision Transformer (ViT) 的孪生网络,以捕获指纹对中的长程依赖和全局上下文。它为指纹对齐提供可解释的密集像素级特征点对应关系,并增强后续匹配阶段的可解释性。第二个模块考虑对齐后指纹对的局部和全局表示,以实现可解释的定长表示提取与匹配。它利用在第一个模块中训练的 ViT,附加全连接层并重新训练,以同时产生具有判别性的定长表示和可解释的密集像素级特征点对应关系。在多个公开指纹数据库上的大量实验结果表明,所提出的框架不仅在密集配准和匹配方面表现出优越的性能,而且显著提升了基于深度定长表示的指纹匹配的可解释性。

关键词

引用

@article{arxiv.2404.08237,
  title  = {IFViT: Interpretable Fixed-Length Representation for Fingerprint Matching via Vision Transformer},
  author = {Yuhang Qiu and Honghui Chen and Xingbo Dong and Zheng Lin and Iman Yi Liao and Massimo Tistarelli and Zhe Jin},
  journal= {arXiv preprint arXiv:2404.08237},
  year   = {2024}
}

备注

ready to submit to IEEE Transactions on Information Forensics and Security (TIFS)