中文

GGViT:面向 Face2Face 面部重演检测的多元流视觉 Transformer 网络

计算机视觉与模式识别 2022-10-13 v1

摘要

检测社交网络上的篡改面部图像与视频已成为亟待解决的问题。社交媒体对视频的压缩破坏了部分可用于检测伪造的像素细节。因此,在不同质量的视频中检测篡改人脸至关重要。我们提出了一种名为 GGViT 的新型多流网络架构,其利用全局信息提升模型的泛化能力。由 ViT 提取的整脸嵌入将引导各流网络。通过大量实验,我们证明了所提模型在 FF++ 数据集上取得了最先进的分类准确率,并在不同压缩率的场景下获得大幅提升。Raw/C23、Raw/C40 与 C23/C40 的准确率分别提升了 24.34%、15.08% 与 10.14%。

关键词

引用

@article{arxiv.2210.05990,
  title  = {GGViT:Multistream Vision Transformer Network in Face2Face Facial Reenactment Detection},
  author = {Haotian Wu and Peipei Wang and Xin Wang and Ji Xiang and Rui Gong},
  journal= {arXiv preprint arXiv:2210.05990},
  year   = {2022}
}

备注

6 pages,4 figures,to be published in ICPR2022