基于下一帧特征预测的多模态深度伪造检测与时间局部化
计算机视觉与模式识别
2025-11-14 v1
摘要
近期针对多模态深度伪造检测的方法假设单阶段监督训练难以在未见操纵和数据集上实现泛化。然而,这些以泛化为目标的方法需要在真实样本上进行预训练。此外,这些方法主要关注检测音视频不一致性,可能忽视导致失败的单模态性残留。为此,我们提出单阶段训练框架,通过为单模态和跨模态特征引入下一帧预测,增强泛化能力。此外,我们引入窗口级注意力机制,捕获预测帧与实际帧之间的差异,使模型能够在每个帧附近检测局部残留,这对于准确分类完全操纵的视频以及有效定位部分欺骗样本中的深度伪造片段至关重要。我们的方法在多个基准数据集上进行评估,显示出强大的泛化能力和精确的时间局部化性能。
引用
@article{arxiv.2511.10212,
title = {Next-Frame Feature Prediction for Multimodal Deepfake Detection and Temporal Localization},
author = {Ashutosh Anshul and Shreyas Gopal and Deepu Rajan and Eng Siong Chng},
journal= {arXiv preprint arXiv:2511.10212},
year = {2025}
}
备注
Under Review, Multimodal Deepfake detection