EditSleuth:面向图像编辑鉴 forensics 的基于 grounding reasoning chain 的数据集
摘要
图像 AI 编辑 forensics 的 forensic 分析远不止二元的 real-versus-fake 预测:一个有用的系统应当局部化 edit,识别其语义类型,并以视觉证据为其决策提供依据。现有的 image-forensics 数据集通常侧重于检测或局部化,而面向 image manipulation 的 reasoning-supervised vision-language 数据集很少针对图像操纵,且常依赖 LLM 生成的 rationales,难以验证其忠实性。我们引入 EditSleuth,这是一个来自现有 image-editing 语料库构建的包含 257,725 个 image-edit 三元组的数据集,用于 grounded image-edit forensic reasoning。每个示例包括一个被编辑后的图像、其 source 图像、一个 binary edit mask、12 类 edit taxonomy label、一个 difficulty score,以及一个六步 reasoning chain。EditSleuth 的 chain 是从 triplet-grounded upstream artifacts 中确定性生成的,每个 statement 都与特定的可计算 evidence source 绑定。我们的分析揭示,一个朴素的四组件 difficulty 公式在 magnitude features 之间出现 rank-2 correlation collapse;简化为三组件公式在 Pico-Banana 和 MagicBrush 上显著增加了 score 活度。difficulty 在大多数 edit 类别中也有着有意义的变化,表明该分数并非 edit type 的 proxy。作为初始学习研究,我们对 Qwen2-VL-2B 使用 LoRA 进行 fine-tune,发现 chain-as-target supervision 在可解析答案的 classification accuracy 上与 label-only baseline 相当,同时还能产生 label-only supervision 无法获得的 grounded explanatory prose。我们发布了数据集、确定性构建管道以及 pilot training 脚本。
引用
@article{arxiv.2605.08695,
title = {EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics},
author = {Van-Loc Nguyen and AprilPyone MaungMaung and Minh-Triet Tran and Isao Echizen},
journal= {arXiv preprint arXiv:2605.08695},
year = {2026}
}