中文

AIForge-Doc:面向金融与表格文档的人工智能伪造篡改检测基准

计算机视觉与模式识别 2026-02-25 v1

摘要

我们提出了 AIForge-Doc,这是首个专门针对基于扩散模型的文档 inpainting 进行像素级标注的基准测试。现有文档伪造数据集依赖传统数字编辑工具(如 Adobe Photoshop、GIMP),导致一个关键缺口:现有最先进的检测器对日益增长的 AI 伪造文档欺诈威胁视而不见。AIForge-Doc 通过系统性地使用两项 AI inpainting API(Gemini 2.5 Flash Image 和 Ideogram v2 Edit)对真实世界收据和表格图像中的数值字段进行伪造,生成 4061 张伪造图像,来自四个公开文档数据集(CORD、WildReceipt、SROIE、XFUND),覆盖九种语言,并以 DocTamper 兼容格式提供像素精确的篡改区域掩码。我们对三类代表性检测器进行基准测试——TruFor、DocTamper 和零-shot GPT-4o 判官,发现所有现有方法都会大幅退化:TruFor 在零-shot、跨域情境下的 AUC 为 0.751,远低于 NIST16 中的 0.96;DocTamper 在原分布内的 AUC 为 0.98,却在跨域情境下降至 0.563,像素级 IoU 为 0.020;GPT-4o 仅得 0.509——基本处于随机水平,这确认了 AI 伪造的值对自动化检测器和视觉语言模型而言几乎不可区分。这些结果表明,AIForge-Doc 代表了文档 forensics 领域的一个全新且尚未解决的挑战。

关键词

引用

@article{arxiv.2602.20569,
  title  = {AIForge-Doc: A Benchmark for Detecting AI-Forged Tampering in Financial and Form Documents},
  author = {Jiaqi Wu and Yuchen Zhou and Muduo Xu and Zisheng Liang and Simiao Ren and Jiayu Xue and Meige Yang and Siying Chen and Jingheng Huan},
  journal= {arXiv preprint arXiv:2602.20569},
  year   = {2026}
}

备注

17 pages, 10 figures