FakeBench: 通过大型多模态模型探索可解释的假图检测
计算机视觉与模式识别
2024-09-10 v2 多媒体
摘要
区分图像是否由人工智能生成是人类智能的关键能力,通常伴随着复杂的辩证取证和推理过程。然而,当前的假图检测模型和数据库侧重于二元分类,没有对普通大众提供可理解的解释。这削弱了真实性判断的可信度,并可能隐藏潜在的模型偏差。同时,大型多模态模型在各种任务中展示了巨大的视觉-文本能力,为可解释的假图检测带来了潜力。因此,我们率先探索大型多模态模型用于可解释假图检测,通过提出一个包含文本真实性描述的多模态数据库FakeBench。在构建中,我们首先引入了一个关于人类感知的生成视觉伪造的细粒度分类法,基于此我们采用人机交互策略收集人类自然语言的伪造描述。FakeBench通过四个评估标准(检测、推理、解释和细粒度伪造分析)来检验大型多模态模型,以获得对图像真实性相关能力的更深入见解。对各种大型多模态模型的实验证实了它们在假图检测任务不同方面的优缺点。这项研究为假图检测领域带来了透明度的范式转变,并揭示了在视觉语言研究和AI风险控制中需要更加重视取证元素。FakeBench将在https://github.com/Yixuan423/FakeBench提供。
引用
@article{arxiv.2404.13306,
title = {FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models},
author = {Yixuan Li and Xuelin Liu and Xiaoyang Wang and Bu Sung Lee and Shiqi Wang and Anderson Rocha and Weisi Lin},
journal= {arXiv preprint arXiv:2404.13306},
year = {2024}
}