Ivy-Fake:面向图像与视频 AIGC 检测的统一可解释框架与基准
计算机视觉与模式识别
2026-05-06 v6 人工智能
摘要
人工智能生成内容(AIGC)技术的快速发展使得创建高质量合成内容成为可能,但也引发了重大的安全担忧。当前的检测方法面临两个主要局限性:(1)缺乏用于生成图像和视频的多维可解释数据集。现有的开源数据集(例如 WildFake、GenVideo)依赖于过于简化的二元标注,这限制了训练检测器的可解释性和可信度。(2)先前基于 MLLM 的伪造检测器(例如 FakeVLM)在逐步推理中表现出不够精细的可解释性,这阻碍了可靠的定位和解释。为了应对这些挑战,我们引入了 Ivy-Fake,这是第一个用于可解释 AIGC 检测的大规模多模态基准。它包含超过 106K 个标注丰富的训练样本(图像和视频)以及 5,000 个手动验证的评估示例,这些样本源自多个生成模型和真实世界数据集,通过精心设计的流程以确保多样性和质量。此外,我们提出了 Ivy-xDetector,这是一种基于群体相对策略优化(GRPO)的强化学习模型,能够产生可解释的推理链,并在多个合成内容检测基准上取得稳健的性能。大量实验证明了我们数据集的优越性,并证实了我们方法的有效性。值得注意的是,我们的方法将 GenImage 上的性能从 86.88% 提高到了 96.32%,以明显的优势超越了先前最先进的方法。
引用
@article{arxiv.2506.00979,
title = {Ivy-Fake: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection},
author = {Changjiang Jiang and Wenhui Dong and Zhonghao Zhang and Fengchang Yu and Wei Peng and Xinbin Yuan and Yifei Bi and Ming Zhao and Zian Zhou and Chenyang Si and Caifeng Shan},
journal= {arXiv preprint arXiv:2506.00979},
year = {2026}
}
备注
Accepted by ICMR 2026