GGViT:面向 Face2Face 面部重演检测的多元流视觉 Transformer 网络
计算机视觉与模式识别
2022-10-13 v1
摘要
检测社交网络上的篡改面部图像与视频已成为亟待解决的问题。社交媒体对视频的压缩破坏了部分可用于检测伪造的像素细节。因此,在不同质量的视频中检测篡改人脸至关重要。我们提出了一种名为 GGViT 的新型多流网络架构,其利用全局信息提升模型的泛化能力。由 ViT 提取的整脸嵌入将引导各流网络。通过大量实验,我们证明了所提模型在 FF++ 数据集上取得了最先进的分类准确率,并在不同压缩率的场景下获得大幅提升。Raw/C23、Raw/C40 与 C23/C40 的准确率分别提升了 24.34%、15.08% 与 10.14%。
引用
@article{arxiv.2210.05990,
title = {GGViT:Multistream Vision Transformer Network in Face2Face Facial Reenactment Detection},
author = {Haotian Wu and Peipei Wang and Xin Wang and Ji Xiang and Rui Gong},
journal= {arXiv preprint arXiv:2210.05990},
year = {2022}
}
备注
6 pages,4 figures,to be published in ICPR2022