TALL:用于深度伪造视频检测的缩略图布局
计算机视觉与模式识别
2024-02-20 v3
摘要
深度伪造对社会和网络安全日益增长的威胁已引起公众极大关切,越来越多的努力投入到深度伪造视频检测这一关键课题中。现有视频方法性能良好但计算密集。本文引入一种简单而有效的策略,称为缩略图布局(TALL),它将视频片段转换为预定义布局以实现空间和时间依赖性的保持。具体而言,连续帧在每帧固定位置被掩码以提高泛化性,然后调整为子图像并重新排列为预定义布局作为缩略图。TALL 与模型无关且极其简单,仅需修改几行代码。受视觉 Transformer 成功的启发,我们将 TALL 融入 Swin Transformer,形成高效且有效的方法 TALL-Swin。在数据集内和跨数据集上的大量实验验证了 TALL 和 SOTA TALL-Swin 的有效性和优越性。TALL-Swin 在具有挑战性的跨数据集任务 FaceForensics++ Celeb-DF 上达到了 90.79 AUC。代码可在 https://github.com/rainy-xu/TALL4Deepfake 获取。
引用
@article{arxiv.2307.07494,
title = {TALL: Thumbnail Layout for Deepfake Video Detection},
author = {Yuting Xu and Jian Liang and Gengyun Jia and Ziming Yang and Yanhao Zhang and Ran He},
journal= {arXiv preprint arXiv:2307.07494},
year = {2024}
}
备注
Accepted by ICCV 2023; We revised the first paragraph of section 3