BusterX++: 用于统一跨模态 AI 生成内容检测与解释的 MLLM
计算机视觉与模式识别
2026-01-07 v3
摘要
近期生成式 AI 的快速发展显著提升了图像和视频合成能力,大幅增加了通过复杂假内容传播误information 的风险。为此,检测方法从传统方法演进为采用多模态大语言模型(MLLM),在识别合成媒体时提供了更好的透明度和可解释性。然而,当前检测系统在根本上受限于单模态设计。这些方法分别分析图像或视频,对结合多种媒介格式的合成内容毫无效用。为此,我们提出 \textbf{BusterX++},一个用于统一检测和解释合成图像和视频的框架,并采用直接强化学习(RL)后训练策略。为实现全面评估,我们还构建了 \textbf{GenBuster++},一个利用最新图像和视频生成技术的统一基准数据集。该基准包含 4000 张图片和视频片段,由人类专家仔细筛选,确保高质量、多样性和现实可应用性。大量实验表明,我们的方法在有效性和通用性方面均表现优异。
引用
@article{arxiv.2507.14632,
title = {BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM},
author = {Haiquan Wen and Tianxiao Li and Zhenglin Huang and Yiwei He and Guangliang Cheng},
journal= {arXiv preprint arXiv:2507.14632},
year = {2026}
}