基于自适应平均池化的注意力视觉Transformer用于人脸反欺骗
图像与视频处理
2024-01-11 v1 信号处理
摘要
传统视觉Transformer由两部分组成:Transformer编码器和多层感知机(MLP)。前者扮演特征学习的角色以获得更好的表示,而后者扮演分类的角色。这里,MLP由两个全连接(FC)层、平均值计算模块、FC层和softmax层构成。然而,由于使用了平均值计算模块,一些有用信息可能会丢失,我们计划通过使用替代框架来保留这些信息。在这项工作中,我们提出了一种新颖的视觉Transformer,称为基于自适应平均池化的注意力视觉Transformer(AAViT),它使用自适应平均池化和注意力模块来替代平均值计算模块。我们探索了所提出的AAViT在Replay-Attack数据库上进行人脸反欺骗研究。实验表明,AAViT在人脸反欺骗方面优于视觉Transformer,产生了更低的等错误率。此外,我们发现所提出的AAViT在Replay-Attack语料库上的表现远优于一些常用神经网络(如ResNet)和其他已知系统。
引用
@article{arxiv.2401.04953,
title = {Adaptive-avg-pooling based Attention Vision Transformer for Face Anti-spoofing},
author = {Jichen Yang and Fangfan Chen and Rohan Kumar Das and Zhengyu Zhu and Shunsi Zhang},
journal= {arXiv preprint arXiv:2401.04953},
year = {2024}
}
备注
Accepted for Publication in IEEE ICASSP 2024