FakeTransformer:从面部像素变化建模的时空表征中揭露人脸伪造
计算机视觉与模式识别
2021-11-16 v1
摘要
随着生成模型的快速发展,被称为DeepFakes的基于AI的人脸操控技术已变得越来越逼真。这种人脸伪造手段可攻击任意目标,对个人隐私与财产安全构成新威胁。此外,合成视频的滥用在身份骚扰、色情与新闻谣言等诸多领域显示出潜在危险。受生成内容中生理信号的空间相干性与时间一致性被破坏这一事实启发,我们试图从与人脸像素变化高度相关的生理信息中,寻找可区分真实视频与合成视频的不一致模式。我们的方法首先对原始视频在多高斯尺度上应用欧拉视频放大(EVM)以放大由面部血容量变化引起的生理变化,然后将原始视频与放大视频转换为多尺度欧拉放大时空图(MEMSTmap),其可表示不同倍频程上随时间变化的生理增强序列。随后,这些图按列单位重塑为帧块并送入视觉Transformer以学习帧级时空描述子。最后,我们梳理特征嵌入并输出判断视频真假的概率。我们在FaceForensics++与DeepFake Detection数据集上验证了方法。结果表明,我们的模型在伪造检测中取得优异性能,并在跨数据域中展现出卓越泛化能力。
引用
@article{arxiv.2111.07601,
title = {FakeTransformer: Exposing Face Forgery From Spatial-Temporal Representation Modeled By Facial Pixel Variations},
author = {Yuyang Sun and Zhiyong Zhang and Changzhen Qiu and Liang Wang and Zekai Wang},
journal= {arXiv preprint arXiv:2111.07601},
year = {2021}
}