DOCFORGE-BENCH:面向文档伪造检测与分析的综合 0 -shot 基准
计算机视觉与模式识别
2026-03-11 v2
摘要
我们提出DOCFORGE-BENCH,这是首个统一的零样文档伪造检测基准,评估了14种方法在8个数据集上的表现,这些数据集涵盖文本篡改、收据伪造和身份证件篡改。不同于面向微调的评估(如ForensicHub),DOCFORGE-BENCH对所有方法均使用其已发布的预训练权重且不进行域适应——这一设计选择反映了实际部署场景,即实践者 lacks 标记的文档训练数据。我们的核心发现是:在单阈值协议下不可见的普遍校准失效:方法在Pixel-AUC上取得中等水平(≥0.76),但Pixel-F1接近零。这一AUC-F1间隙并非判别失效,而是得分分布迁移:文档图像中被篡改区域仅占0.27-4.17%的像素——低于自然图像基准的数量级,这使得标准τ=0.5阈值在实际应用中严重误校准。Oracle-F1是固定阈值Pixel-F1的2-10倍,证明校准(而非表示)是瓶颈。受控校准实验验证了这一点:在N=10个域图像上调整单个阈值即可恢复39-55%的Oracle-F1间隙,表明阈值调整(而非重新训练)是实际部署的关键缺失步骤。总体而言,评估的所有方法在多样化文档类型上均无法实现可靠的开箱即用, underscores 文档伪造检测仍是未解决的问题。我们进一步指出,所有8个数据集均源于生成式AI编辑之前的时代;覆盖扩散模型和LLM 基于文档伪造的数据集构成了针对现代攻击面的关键开放空白。
引用
@article{arxiv.2603.01433,
title = {DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis},
author = {Zengqi Zhao and Weidi Xia and En Wei and Yan Zhang and Jane Mo and Tiannan Zhang and Yuanqin Dai and Zexi Chen and Yiran Tao and Simiao Ren},
journal= {arXiv preprint arXiv:2603.01433},
year = {2026}
}