RAIDX:面向可解释深度伪造检测的检索增强生成与 GRPO 强化学习框架
计算机视觉与模式识别
2025-08-07 v1 人工智能
摘要
AI 生成模型的快速发展使能够创建逼真的图像,throughout poses ethical risks via widespread misinformation。当前的深度伪造检测方法,分为面向人脸的检测器或通用 AI 生成检测器,缺乏透明度,因将检测任务框架为分类任务而无法解释决策。虽然有多个基于大语言模型 (LLM) 的方法提供可解释性,但 suffer from coarse-grained analyses and dependency on labor-intensive annotations。本文引入 RAIDX (Retrieval-Augmented Image Deepfake Detection and Explainability),一种新型深度伪造检测框架,将检索增强生成 (RAG) 和群相对政策优化 (GRPO) 集成以提高检测准确性和决策可解释性。具体而言,RAIDX 利用 RAG 融合外部知识以提高检测准确性,并采用 GRPO 自主生成细粒度文本解释和显著性图,从而消除对大量手动标注的依赖。在多个基准数据集上的实验表明,RAIDX 在识别真实或伪造图像方面效果显著,能够提供可解释的文本描述和显著性图,实现了最先进的检测性能,同时推动了深度伪造识别的透明度。RAIDX 是首个同步集成 RAG 与 GRPO 的统一框架,解决了准确性和可解释性之间的关键空白。我们的代码和模型将公开 disponible。
引用
@article{arxiv.2508.04524,
title = {RAIDX: A Retrieval-Augmented Generation and GRPO Reinforcement Learning Framework for Explainable Deepfake Detection},
author = {Tianxiao Li and Zhenglin Huang and Haiquan Wen and Yiwei He and Shuchang Lyu and Baoyuan Wu and Guangliang Cheng},
journal= {arXiv preprint arXiv:2508.04524},
year = {2025}
}