TalkingHeadBench:说话人头部深度伪造检测的多模态基准与分析
计算机视觉与模式识别
2026-01-21 v3
摘要
由先进生成模型推动的说话人头部深度伪造生成的快速发展,已将合成视频的真实性提升到在媒体、政治和金融等领域构成重大风险的水平。然而,当前的深度伪造说话人头部检测基准未能反映这一进展,它们依赖于过时的生成器,且对模型的鲁棒性和泛化能力提供的洞察有限。我们引入了 TalkingHeadBench,这是一个全面的多模型、多生成器基准和精选数据集,旨在评估最先进的检测器在最先进生成器上的性能。我们的数据集包括由领先的学术和商业模型合成的深度伪造视频,并精心构建了评估协议,以评估在身份和生成器特征分布偏移下的泛化能力。我们对多种现有检测方法进行了基准测试,包括 CNN、视觉 Transformer 和时序模型,并分析了它们的鲁棒性和泛化能力。此外,我们使用 Grad-CAM 可视化进行了误差分析,以揭示常见的失败模式和检测器偏差。TalkingHeadBench 托管于 https://huggingface.co/datasets/luchaoqi/TalkingHeadBench,开放访问所有数据划分和协议。我们的基准旨在加速研究,以在面对快速演变的生成技术时开发出更鲁棒和可泛化的检测模型。
引用
@article{arxiv.2505.24866,
title = {TalkingHeadBench: A Multi-Modal Benchmark & Analysis of Talking-Head DeepFake Detection},
author = {Xinqi Xiong and Prakrut Patel and Qingyuan Fan and Amisha Wadhwa and Sarathy Selvam and Xiao Guo and Luchao Qi and Xiaoming Liu and Roni Sengupta},
journal= {arXiv preprint arXiv:2505.24866},
year = {2026}
}
备注
WACV2026