G$^2$V$^2$former:用于人脸反欺骗的图引导视频视觉Transformer
计算机视觉与模式识别
2025-02-25 v2
摘要
在包含欺骗人脸的视频中,我们可以基于光度异常或动态异常,甚至两者的组合来发现欺骗证据。当前主流的人脸反欺骗(FAS)方法通常聚焦于单帧场景,然而纯粹基于光度驱动的方法会忽略随时间暴露的动态欺骗线索。这可能导致FAS系统做出错误判断,尤其是在动态方面易于区分但光度方面难以辨别的情况下。为此,我们提出了图引导视频视觉Transformer(GVformer),它将人脸与面部关键点结合进行光度和动态特征融合。我们将注意力分解为空间和时间,并通过时空块进行融合。具体而言,我们设计了一种新颖的时间注意力——Kronecker时间注意力,具有更宽的感受野,有利于捕获动态信息。此外,我们利用面部关键点的低语义运动来引导面部表情的高语义变化,其动机在于包含关键点的区域可能揭示更多动态线索。在九个基准数据集上的大量实验表明,我们的方法在各种场景下均取得了优越性能。代码将很快发布。
引用
@article{arxiv.2408.07675,
title = {G$^2$V$^2$former: Graph Guided Video Vision Transformer for Face Anti-Spoofing},
author = {Jingyi Yang and Zitong Yu and Xiuming Ni and Jia He and Hui Li},
journal= {arXiv preprint arXiv:2408.07675},
year = {2025}
}
备注
11 pages, 5 figures