代码-循环 鉴定:基于代理工具的图像伪造检测
人工智能
2026-04-06 v2
摘要
现有图像伪造检测(IFD)方法要么利用低层次、语义不可知的痕迹,要么依赖具有高层次语义知识的多模态大语言模型(MLLM)。尽管这两种信息流在范式和推理方式上具有天然的互补性,但现有方法难以将其统一或有效建模其跨层次的相互作用。为此,我们提出了 ForenAgent—a 多轮交互式 IFD 框架,使 MLLM 能够自主生成、执行并迭代细化围绕检测目标的基于 Python 的低层工具,从而实现更灵活、可解释的伪造分析。ForenAgent 遵循由 Cold Start 与强化微调组成的两阶段训练流程,以逐步提升其工具交互能力与推理适应性。灵感来源于人类推理,我们设计包含全局感知、局部聚焦、迭代探测与整体裁决四个环节的动态推理循环,并将其作为数据采样策略与任务对齐过程奖励。为系统化训练与评估,我们构建了 FABench—a 包含 10 万张图像及约 20 万轮代理交互问答对的异构高质量代理鉴定数据集。实验表明,ForenAgent 在获得低层工具辅助下,能在具有挑战性的 IFD 任务中展现出涌现的工具使用能力与反思性推理,为通用 IFD 指明了前景。代码将在审稿结束后公开。
引用
@article{arxiv.2512.16300,
title = {Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection},
author = {Fanrui Zhang and Qiang Zhang and Sizhuo Zhou and Jianwen Sun and Chuanhao Li and Jiaxin Ai and Yukang Feng and Yujie Zhang and Wenjie Li and Zizhen Li and Yifan Chang and Jiawei Liu and Kaipeng Zhang},
journal= {arXiv preprint arXiv:2512.16300},
year = {2026}
}
备注
18 pages, 7 figures