EDVD-LLaMA:基于多模态大语言模型推理的可解释深度伪造视频检测
计算机视觉与模式识别
2025-12-22 v2 人工智能
摘要
深度伪造视频技术的快速发展不仅促进了艺术创作,也更容易传播误信息。传统的深度伪造视频检测(DVD)方法面临着原理缺乏透明度和难以应对不断演变的伪造技术的泛化能力不足的问题。这凸显了迫切需要能够识别伪造内容并提供可验证推理解释的检测器。本文提出了可解释深度伪造视频检测(EDVD)任务,并设计了 EDVD-LLaMA 多模态大语言模型(MLLM)推理框架,提供可追溯的推理过程,伴随准确的检测结果和可信的解释。我们的方案首先引入了时空细微信息分词(ST-SIT),用于提取和融合全局和局部跨帧深度伪造特征,为 MLLM 推理提供丰富的时空语义信息。其次,我们构建了细粒度多模态链式思考(Fg-MCoT)机制,在推理过程中引入面部特征数据作为硬约束,以实现像素级时空视频定位,抑制幻觉输出,增强链式思考的可靠性。此外,我们构建了一个可解释推理 FF++ 数据集(ER-FF++set),利用结构化数据标注视频并确保质量控制,从而支持推理和检测的双重监督。大量实验表明,EDVD-LLaMA 在检测准确率、可解释性以及处理跨伪造方法和跨数据集情景方面表现卓越。与以往的 DVD 方法相比,它提供了更具可解释性和优越性的解决方案。项目页面可访问于:https://11ouo1.github.io/edvd-llama/。
引用
@article{arxiv.2510.16442,
title = {EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning},
author = {Haoran Sun and Chen Cai and Huiping Zhuang and Kong Aik Lee and Lap-Pui Chau and Yi Wang},
journal= {arXiv preprint arXiv:2510.16442},
year = {2025}
}