中文

G$^2$V$^2$former:用于人脸反欺骗的图引导视频视觉Transformer

计算机视觉与模式识别 2025-02-25 v2

摘要

在包含欺骗人脸的视频中,我们可以基于光度异常或动态异常,甚至两者的组合来发现欺骗证据。当前主流的人脸反欺骗(FAS)方法通常聚焦于单帧场景,然而纯粹基于光度驱动的方法会忽略随时间暴露的动态欺骗线索。这可能导致FAS系统做出错误判断,尤其是在动态方面易于区分但光度方面难以辨别的情况下。为此,我们提出了图引导视频视觉Transformer(G2^2V2^2former),它将人脸与面部关键点结合进行光度和动态特征融合。我们将注意力分解为空间和时间,并通过时空块进行融合。具体而言,我们设计了一种新颖的时间注意力——Kronecker时间注意力,具有更宽的感受野,有利于捕获动态信息。此外,我们利用面部关键点的低语义运动来引导面部表情的高语义变化,其动机在于包含关键点的区域可能揭示更多动态线索。在九个基准数据集上的大量实验表明,我们的方法在各种场景下均取得了优越性能。代码将很快发布。

关键词

引用

@article{arxiv.2408.07675,
  title  = {G$^2$V$^2$former: Graph Guided Video Vision Transformer for Face Anti-Spoofing},
  author = {Jingyi Yang and Zitong Yu and Xiuming Ni and Jia He and Hui Li},
  journal= {arXiv preprint arXiv:2408.07675},
  year   = {2025}
}

备注

11 pages, 5 figures