中文

挖掘Vanilla MLLMs在 forgery 检测中的潜能:一种无需训练的新型管道

计算机视觉与模式识别 2025-11-19 v2 人工智能

摘要

随着人工智能生成内容(AIGC)技术的快速发展,包括多模态大语言模型(MLLMs)和扩散模型,图像生成与操纵变得异常容易。现有的图像伪造检测与定位(IFDL)方法往往难以在不同数据集之间泛化,并提供有限的可解释性。如今,MLLMs在各种视觉语言任务中展现出强大的泛化潜力,一些研究通过大规模训练将此能力引入IFDL。然而,这些方法需要大量计算资源,同时未能揭示Vanilla MLLMs解决此问题的内在泛化潜力。鼓励此观察后,我们提出了Foresee,一个针对图像伪造分析的无需训练的MLLMs管道。它消除了额外训练的需求,实现了轻量级的推理过程,同时在伪造定位精度和文本解释丰富性方面均超越了现有的MLLMs方法。Foresee采用类型先验驱动策略,并利用灵活特征检测器(FFD)模块专门处理复制移动操纵,从而有效释放Vanilla MLLMs在司法领域的潜力。大量实验表明,我们的方法同时实现了卓越的定位精度和更全面的文本解释。此外,Foresee表现出更强的泛化能力,在各种篡改类型(包括复制移动、拼接、删除、局部增强、深度伪造和AIGC-based编辑)方面均优于现有的IFDL方法。最终版本将发布代码。

关键词

引用

@article{arxiv.2511.13442,
  title  = {Unlocking the Forgery Detection Potential of Vanilla MLLMs: A Novel Training-Free Pipeline},
  author = {Rui Zuo and Qinyue Tong and Zhe-Ming Lu and Ziqian Lu},
  journal= {arXiv preprint arXiv:2511.13442},
  year   = {2025}
}