BusterX:基于 MLLM 的 AI 生成视频伪造检测与解释
计算机视觉与模式识别
2026-03-09 v7
摘要
随着生成视频模型逐渐趋于真实,检测 AI 生成视频的系统需要兼具准确性与可解释性。然而, currently 将 MLLM 应用于视频取证受限于过时的 dataset、单调的评估协议以及依赖黑箱分类器。为此,本文引入了包括数据集、基准和基线模型在内的完整解决方案用于视频伪造检测。首先,我们提出了 \textbf{GenBuster-200K},一个来自最先进生成器的 20 万+ 高质量视频数据集,涵盖多样化的真实场景。其次,我们提出了 \textbf{GenBuster-Bench},一个覆盖三个渐进轨道(In-Domain、Out-of-Domain 和 In-the-Wild)的诊断基准,用于评估模型在 \textit{domain shifts} 和 \textit{generational shifts} 上的表现。基准还引入了 MLLM 作为评判员的协议,以评估生成的 forensic explanation 的质量。最后,我们开发了 \textbf{BusterX},一个进行 RL 训练的 MLLM 基线。BusterX 不采用直接的二元分类,而是将检测任务形式化为视觉推理任务,其中生成的推理链即作为检测器本身。实验结果表明,BusterX 在检测准确率和理由质量方面均优于多个领先 MLLM(如 Qwen3.5、Claude-Sonnet-4.6)。
引用
@article{arxiv.2505.12620,
title = {BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation},
author = {Haiquan Wen and Yiwei He and Zhenglin Huang and Tianxiao Li and Zihan Yu and Xingru Huang and Lu Qi and Baoyuan Wu and Xiangtai Li and Guangliang Cheng},
journal= {arXiv preprint arXiv:2505.12620},
year = {2026}
}