多模态(推理)大语言模型能否作为深度伪造检测器?
计算机视觉与模式识别
2025-04-01 v2 人工智能
摘要
深度伪造检测仍然是面对日益发达的生成模型时代的关键挑战,特别是随着合成媒体变得越来越复杂。在本研究中,我们探讨了最新进展的多模态(推理)大语言模型(LLM)用于深度伪造图像检测(如 OpenAI O1/4o、Gemini thinking Flash 2、Deepseek Janus、Grok 3、llama 3.2、Qwen 2/2.5 VL、Mistral Pixtral、Claude 3.5/3.7 sonnet)的潜力。我们对 12 个最新的多模态 LLM 进行基准测试,对比传统深度伪造检测方法,涵盖多个数据集,包括最近发布的真实世界深度伪造图像。为提升性能,我们采用 prompt tuning 并深入分析模型的推理路径,以识别其决策过程中的关键贡献因素。我们的发现表明,最好的多模态 LLM 在零样本条件下实现了具竞争力的性能,具有良好的泛化能力,甚至在分布外数据集中超越传统深度伪造检测管线,而其他 LLM 家族的表现极为不佳,一些甚至低于随机猜测。此外,我们发现较新的模型版本和推理能力并不助长此类深度伪造检测这类狭窄任务的性能,而模型规模在某些情况下有所帮助。这一研究突显了在未来深度伪造检测框架中集成多模态推理的潜力,并为增强现实场景下的模型可解释性提供了见解。
引用
@article{arxiv.2503.20084,
title = {Can Multi-modal (reasoning) LLMs work as deepfake detectors?},
author = {Simiao Ren and Yao Yao and Kidus Zewde and Zisheng Liang and Tsang and Ng and Ning-Yau Cheng and Xiaoou Zhan and Qinzhe Liu and Yifei Chen and Hengwei Xu},
journal= {arXiv preprint arXiv:2503.20084},
year = {2025}
}