多尺度自适应冲突平衡模型用于多媒体深度伪造检测
计算机视觉与模式识别
2025-05-20 v1 人工智能
摘要
计算机视觉和深度学习的进步模糊了深度伪造与真实媒介之间的界限,通过音频视觉伪造削弱了多媒体可信度。当前的多模态检测方法受限于模态之间学习的不平衡。为解决这一问题,我们提出了音频视觉联合学习方法(MACB-DF),通过对比学习辅助多层次和跨模态融合,以更好地缓解模态冲突和忽视,充分平衡和利用每个模态的信息。此外,我们设计了一个正交化多模态帕累托模块,既保留单模态信息,又解决由于损失函数不同优化目标导致的音视频编码器中的梯度冲突。在主流深度伪造数据集上进行的大量实验和消融研究表明,我们的方法在关键评估指标上均实现了一致的性能提升,平均准确率达到95.5%。值得注意的是,我们的方法在跨数据集泛化能力方面表现突出,在DFDC上训练、在DefakeAVMiT和FakeAVCeleb上测试时,准确率提升分别为8.0%和7.7%。
引用
@article{arxiv.2505.12966,
title = {Multiscale Adaptive Conflict-Balancing Model For Multimedia Deepfake Detection},
author = {Zihan Xiong and Xiaohua Wu and Lei Chen and Fangqi Lou},
journal= {arXiv preprint arXiv:2505.12966},
year = {2025}
}
备注
9 pages,ICMR accepted