CAM-VFD:基于跨注意力的多模态视频伪造检测
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
深度伪造技术和视频编辑工具的快速发展,对多媒体 forensics、司法证据完整性和信息真实性构成严重挑战。当前检测器依赖单一模态信号,将外观、几何和运动独立处理。然而,高级生成器在保持单模态一致性的同时产生跨模态矛盾,这些矛盾在 Forensically 中具有判别性,但对任何单模态检测器不可见。我们提出CAM-VFD框架,一种跨注意力多模态视频伪造检测方法,该方法将跨模态矛盾建模为方向性 Forensic 信号。该框架在CLIP基于外观表示充当查询器,对VideoMAE运动特征和MiDaS深度特征进行跨注意力融合,从而识别视觉、时序和几何证据之间的矛盾。我们通过跨模态注意力偏差分析评估了该设计,观察到统计上可分离的真实和伪造分布 (, Cohen's )。在两个生成视频基准上进行实验,结果表明性能稳健,GenVidBench上Top-1准确率达95.31%,GenVideo上准确率为93.43%,F1分数90.63%,AUROC为96.56%。此外,CAM-VFD在压缩、噪声、模糊和对抗性扰动下表现稳定,表明跨模态推理可能提高媒体 forensics的鲁棒性。代码已公开于\url{https://github.com/Hoda-Osama/CAM-VFD/tree/main}。
引用
@article{arxiv.2605.17133,
title = {CAM-VFD: Cross-Attention Multimodal Video Forgery Detection},
author = {Hoda Osama Elkhodary and Sherin Mostafa Youssef and Marwa Elshenawy and Dalia Sobhy},
journal= {arXiv preprint arXiv:2605.17133},
year = {2026}
}