SynthForensics:面向人物导向的合成视频深度伪造基准测试与评估
计算机视觉与模式识别
2026-05-11 v2
摘要
现代 T2V/I2V 生成器合成的人物视频日益难以区分于真实 footage,而当前评估套件仍落后:旧有基准针对 manipulation-based forgeries,而近期的合成视频基准则侧重规模而不注重真实的人类呈现。我们引入 SynthForensics,一个面向人物导向的基准,包含 20,445 个视频,来自 8 个 T2V 和 7 个 I2V 开源生成器,配对来源于 FF++/DFD reals,经过两阶段人类验证,包含四种压缩版本并附带完整元数据。在我们的配对比较人类研究中,评委在对比每个现有九个合成视频基准时,偏好 SynthForensics 的比例为 71%--77%;面部质量指标落在 FF++/DFD 基线范围内。在 15 个检测器和三个协议中,面部基于的方法从 FF++ 降至 SynthForensics 时,平均下降 27 个 AUC 点,区间为 13--55 点;在激进压缩下进一步下降 23 点;微调在旧有基准上可缩小差距,但代价为向后迁移;从头训练显示,合成特征与 manipulation 特征在大多数检测器中 largely disjoint。我们发布数据集、管道和代码。
引用
@article{arxiv.2602.04939,
title = {SynthForensics: Benchmarking and Evaluating People-Centric Synthetic Video Deepfakes},
author = {Roberto Leotta and Salvatore Alfio Sambataro and Claudio Vittorio Ragaglia and Mirko Casu and Yuri Petralia and Francesco Guarnera and Luca Guarnera and Sebastiano Battiato},
journal= {arXiv preprint arXiv:2602.04939},
year = {2026}
}