基于多模态大语言和视觉语言模型的支票字段检测代理(CFD-Agent)
计算机视觉与模式识别
2025-09-24 v1 人工智能
摘要
支票仍是金融生态系统中的基础工具,促成了跨机构的大量交易,但其持续使用也使其成为 fraud 的持续目标,凸显了强健支票 fraud 检测机制的重要性。在此类系统的核心在于准确识别和定位关键字段,例如签名、磁性油墨字符识别(MICR)线、 courtesy amount、legal amount、payee 和 payer,这些字段对于后续根据同一客户的参考支票进行验证至关重要。这种字段级检测传统上依赖于在大型、多样且 meticulously 标注的数据集上训练的对象检测模型,而由于专有和隐私问题,这类资源稀缺。本文引入一种新型、无需训练的框架用于自动支票字段检测,利用视觉语言模型(VLM)与多模态大语言模型(MLLM)的强大功能。我们的做法实现了支票组件的 zero-shot 检测,显著降低了在现实金融环境中部署的门槛。对我们模型在手工精选的 110 份支票数据集上的定量评估表明,其表现强劲且具备良好的泛化能力。此外,该框架可作为生成高质量标注数据集的引导机制,使能够开发针对机构需求的专业实时对象检测模型。
引用
@article{arxiv.2509.18405,
title = {Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models},
author = {Sourav Halder and Jinjun Tong and Xinyu Wu},
journal= {arXiv preprint arXiv:2509.18405},
year = {2025}
}
备注
12 pages, 5 figures, 2 tables