基于跨模态 Forensic 指纹的归因引导多模态深度伪造检测
计算机视觉与模式识别
2026-04-30 v1
摘要
音频-视觉深度伪造已达到令人信服的水平,使感知检测难以实现,威胁媒体完整性和生物识别安全。虽然多模态检测显示出前景,但大多数方法是二元分类任务,往往依赖于数据集特定的artifact,而非真正的生成痕迹。我们认为,无法识别视频如何被伪造的检测器可能正在学习错误的信号。与二元检测不同,归因引导的学习对共享嵌入空间施加更强的几何约束,迫使模型编码生成器特定的 Forensic 内容,而非捷径。我们提出了归因引导的多模态深度伪造检测(AMDD)框架,联合学习检测与归因。AMDD 将生成器归因视为约束表示几何的结构化正则化,迫使其趋向于 Forensically 有意义的特征。我们引入跨模态 Forensic 指纹一致性(CMFFC)损失,以实现生成器在视觉和音频流中引起的artifact之间的对齐。这利用了连贯的操纵在不同模态之间留下相关痕迹的事实,这些痕迹基于语音和面部表情之间的物理耦合,合成管道通常会破坏这种耦合。从结构上讲,我们将 ResNet50 与时间注意力用于视觉编码,对抗预训练的 ResNet18 用于梅尔频谱图,弥合了先前模型中编码器容量差距。在 FakeAVCeleb 上,AMDD 实现了 99.7% 的平衡准确率和 99.8% 的 AUC,归因准确率为 95.9%。跨数据集评估在 DeepfakeTIMIT、DFDM 和 LAV-DF 上表明,真实视频检测具有良好的可迁移性,而对未见生成器的深度伪造检测仍是一个开放挑战,我们对其进行了深入分析。
关键词
引用
@article{arxiv.2604.26453,
title = {Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints},
author = {Wasim Ahmad and Wei Zhang and Xuerui Mao},
journal= {arXiv preprint arXiv:2604.26453},
year = {2026}
}