VRAG-DFD:基于 MLLM 的可验证检索增强深度伪造检测
计算机视觉与模式识别
2026-04-20 v3
摘要
在深度伪造检测(DFD)任务中,研究者提出了两种基于 MLLM 的方法:一种是与小型 DFD 检测器进行互补组合,另一种是静态注入伪造知识。缺乏专业伪造知识会阻碍这些 DFD-MLLMs 的性能。为此,我们深入考虑了两个关键问题:如何为 MLLMs 提供高质量的关联伪造知识?以及如何在噪声参考信息下为 MLLMs 赋予关键推理能力?我们尝试通过结合检索增强生成(RAG)和强化学习(RL)技术来回答上述两个问题。通过 RAG 和 RL 技术,我们提出了 VRAG-DFD 框架,实现准确的动态伪造知识检索和强大的关键推理能力。具体而言,在数据方面,我们构建了两个 RAG 数据集:为 DFD 知识标注的 Forensic Knowledge Database(FKD),以及用于关键推理构建的 Forensic Chain-of-Thought Dataset(F-CoT)。在模型训练方面,我们采用三阶段训练方法(Alignment->SFT->GRPO)逐步培育 MLLM 的关键推理能力。在性能方面,VRAG-DFD 在 DFD 泛化测试中实现了 SOTA 成绩并表现竞争。
引用
@article{arxiv.2604.13660,
title = {VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection},
author = {Hui Han and Shunli Wang and Yandan Zhao and Taiping Yao and Shouhong Ding},
journal= {arXiv preprint arXiv:2604.13660},
year = {2026}
}