中文

无需训练的图像篡改检测与定位上下文取证链

计算机视觉与模式识别 2026-01-22 v3 人工智能 密码学与安全

摘要

图像篡改技术的进步带来了严重的安全威胁,凸显了对有效图像篡改定位(IML)的需求。虽然监督式IML取得了强劲性能,但它依赖于昂贵的像素级标注。现有的弱监督或无训练替代方法通常性能不佳且缺乏可解释性。我们提出了上下文取证链(ICFC),这是一个无需训练的框架,利用多模态大语言模型(MLLM)执行可解释的IML任务。ICFC集成了客观化规则构建与自适应过滤,以建立可靠的知识库,以及一个多步骤渐进式推理流水线,该流水线模拟了从粗略提案到细粒度取证结果的专家取证工作流程。这种设计使得能够系统地利用MLLM推理进行图像级分类、像素级定位和文本级可解释性。在多个基准测试中,ICFC不仅超越了最先进的无训练方法,而且与弱监督和全监督方法相比,也取得了具有竞争力或更优的性能。

关键词

引用

@article{arxiv.2510.10111,
  title  = {Training-Free In-Context Forensic Chain for Image Manipulation Detection and Localization},
  author = {Rui Chen and Bin Liu and Changtao Miao and Xinghao Wang and Yi Li and Tao Gong and Qi Chu and Nenghai Yu},
  journal= {arXiv preprint arXiv:2510.10111},
  year   = {2026}
}

备注

This version was uploaded in error and contains misleading information found in an early draft. The manuscript requires extensive and long-term revisions