GPT4o-Receipt:面向 AI 生成文档鉴定的数据集与人类研究
人工智能
2026-03-26 v2 计算机视觉与模式识别
摘要
人类能否比机器更好地识别 AI 生成的财务文件?我们提出 GPT4o-Receipt,一个包含 1,235 张收据图像的数据集,包含 GPT-4o 生成的收据与来自 established 数据集的真实收据,由五个最先进的多模态大语言模型和 30 位注释员进行评估。我们的发现揭示了一个 striking 的悖论:人类在识别 AI 痕迹方面更好,但在检测 AI 文档方面更差。人类注释员表现出任何评估者中最大的视觉判别差距,但其二元检测 F1 分数明显低于 Claude Sonnet 4 和 Gemini 2.5 Flash。这一悖论在理解其机制后得以解决:AI 生成收据的主要forensic 信号是算术错误——这对视觉检查是不可见的,但对 LLM 来说易于系统验证。人类无法感知 subtotal 错误;LLM 在毫秒级完成验证。除了人类与 LLM 比较,我们的五个模型评估揭示了显著的性能差异和校准差异,这使得简单准确率指标对检测器选择不够。GPT4o-Receipt、评估框架以及所有结果均公开发布,以支持未来在 AI 文档鉴定领域的研究。
引用
@article{arxiv.2603.11442,
title = {GPT4o-Receipt: A Dataset and Human Study for AI-Generated Document Forensics},
author = {Yan Zhang and Simiao Ren and Ankit Raj and En Wei and Dennis Ng and Alex Shen and Jiayu Xue and Yuxin Zhang and Evelyn Marotta},
journal= {arXiv preprint arXiv:2603.11442},
year = {2026}
}
备注
12 pages, 7 figures, 7 tables