中文

UMCL:用于跨压缩率深度伪造检测的单模态生成多模态对比学习

计算机视觉与模式识别 2025-11-25 v1

摘要

在深度伪造检测中,社交媒体平台采用的不同程度的压缩对模型的泛化能力和可靠性构成了重大挑战。尽管现有方法已从单模态进展到多模态方法,但它们面临关键局限:单模态方法在社交媒体流中的数据压缩下难以应对特征退化,而多模态方法需要昂贵的数据收集和标注,并且在现实场景中遭受模态质量或可访问性不一致的问题。为应对这些挑战,我们提出了一种新颖的单模态生成多模态对比学习(UMCL)框架,用于鲁棒的跨压缩率(CCR)深度伪造检测。在训练阶段,我们的方法将单一视觉模态转换为三种互补特征:压缩鲁棒的rPPG信号、时间标志动力学以及来自预训练视觉语言模型的语义嵌入。这些特征通过亲和驱动的语义对齐(ASA)策略明确对齐,该策略通过亲和矩阵建模模态间关系并通过对比学习优化它们的一致性。随后,我们的跨质量相似性学习(CQSL)策略增强了跨压缩率的特征鲁棒性。广泛的实验证明我们的方法在各种压缩率和操作类型上取得了优越性能,建立了鲁棒深度伪造检测的新基准。特别地,即使单个特征退化,我们的方法仍保持高检测准确率,同时通过明确对齐提供关于特征关系的可解释见解。

关键词

引用

@article{arxiv.2511.18983,
  title  = {UMCL: Unimodal-generated Multimodal Contrastive Learning for Cross-compression-rate Deepfake Detection},
  author = {Ching-Yi Lai and Chih-Yu Jian and Pei-Cheng Chuang and Chia-Ming Lee and Chih-Chung Hsu and Chiou-Ting Hsu and Chia-Wen Lin},
  journal= {arXiv preprint arXiv:2511.18983},
  year   = {2025}
}

备注

24-page manuscript accepted to IJCV