基于面罩推理的Forensics驱动MLLM框架用于图像操纵定位
计算机视觉与模式识别
2025-08-26 v1 图像与视频处理
摘要
日益精细化的图像操纵技术对能够可靠检测Alteration并精确定位被篡改区域的 Forensic 解决方案提出了挑战。最近的多模态大语言模型(MLLMs)通过利用世界知识和语义理解实现上下文感知检测,展现了前景,但在感知精细的低层 Forensic 痕迹方面仍显不足。本文提出一种 novel Propose-Rectify 框架,有效地将语义推理与 Forensic 专用分析相结合。在提案阶段,该方法利用针对 Forensic 调整的 LLaVA 模型生成初始的操纵分析和可疑区域的初步定位,这基于语义理解和上下文推理。在校正阶段,我们引入 Forensic 校正模块,通过多尺度 Forensic 特征分析系统性地验证和细化这些初始提案,整合来自多个专用滤波器的技术证据。此外,我们还提出了增强分割模块,将关键 Forensic 线索纳入 SAM 编码图像嵌入中,从而克服内在语义偏见,实现对操纵区域的精确描绘。通过将先进的多模态推理与 established Forensic 方法相结合,本框架确保初始语义提案通过具体技术证据进行系统性验证和完善,从而实现全面的检测准确性和定位精确性。大量实验验证表明,在多样化数据集上本框架实现了 state-of-the-art 性能,具备卓越的鲁棒性和泛化能力。
引用
@article{arxiv.2508.17976,
title = {Propose and Rectify: A Forensics-Driven MLLM Framework for Image Manipulation Localization},
author = {Keyang Zhang and Chenqi Kong and Hui Liu and Bo Ding and Xinghao Jiang and Haoliang Li},
journal= {arXiv preprint arXiv:2508.17976},
year = {2025}
}