中文

CAD:基于跨模态对齐与蒸馏的视频深度伪造检测通用多模态框架

计算机视觉与模式识别 2025-05-22 v1

摘要

多模态深度伪造(视觉和听觉内容同步操纵)的快速出现削弱了仅依赖单一模态特定特征或跨模态不一致性检测器的可靠性。本文首先展示,模态特定的 Forensic 痕迹(如人脸替换痕迹或谱系失真)与模态共享语义错位(如唇语不一致)提供互补证据,忽略任一方面会限制检测性能。现有方法要么简单融合模态特定特征而未调和冲突特性,要么过度关注语义错位而牺牲模态特定细粒度伪 artifact 线索。为此,我们提出通过跨模态对齐与蒸馏(CAD)的通用多模态视频深度伪造检测框架。CAD包含两个核心组件:1) 跨模态对齐识别高层语义同步不一致(如唇语不匹配);2) 跨模态蒸馏在融合时调和特征冲突同时保留模态特定 Forensic 痕迹(如合成音频的谱系失真)。在多模态和单模态(如仅图像/仅视频)深度伪造基准测试上进行大量实验表明,CAD显著优于先前方法,验证了多模态互补信息和谐解集成的必要性。

关键词

引用

@article{arxiv.2505.15233,
  title  = {CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation},
  author = {Yuxuan Du and Zhendong Wang and Yuhao Luo and Caiyong Piao and Zhiyuan Yan and Hao Li and Li Yuan},
  journal= {arXiv preprint arXiv:2505.15233},
  year   = {2025}
}