多模态 (推理) LLM 能否检测文档篡改?
计算机视觉与模式识别
2025-08-18 v1 计算与语言
摘要
文档欺诈构成对依赖安全可验证文档的行业的重大威胁,亟需稳健的检测机制。本研究探讨了最新多模态大型语言模型 (LLMs) 的效能,包括 OpenAI O1、OpenAI 4o、Gemini Flash (thinking)、Deepseek Janus、Grok、Llama 3.2 和 4、Qwen 2 和 2.5 VL、Mistral Pixtral、Claude 3.5 和 3.7 Sonnet 等模型在检测虚假文档方面的表现。我们将这些模型在常规数据集上的基准测试与先前工作进行比较,评估其识别细微欺诈线索的能力,如被篡改的文本、格式错位以及不一致的交易总额。结果显示,顶级多模态 LLMs 表现出优异的零样例泛化能力,在分布外数据集上超越传统方法,而多个视觉 LLMs 则表现出不一致或欠佳的性能。值得注意的是,模型规模与高级推理能力与检测准确性关联性有限,表明特定任务的精调至关重要。本研究凸显了多模态 LLMs 在提升文档欺诈检测系统方面的潜力,并为未来研究可解释且可扩展的欺诈缓解策略奠定了基础。
引用
@article{arxiv.2508.11021,
title = {Can Multi-modal (reasoning) LLMs detect document manipulation?},
author = {Zisheng Liang and Kidus Zewde and Rudra Pratap Singh and Disha Patil and Zexi Chen and Jiayu Xue and Yao Yao and Yifei Chen and Qinzhe Liu and Simiao Ren},
journal= {arXiv preprint arXiv:2508.11021},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2503.20084