长型扫描财务文件多阶段信息抽取管道:工业KYC工作流程中的实证研究
计算机视觉与模式识别
2026-04-30 v1
摘要
从长篇、多语言扫描财务文件中抽取结构化信息,是工业KYC和合规工作流程中的核心需求。这些文件通常非机器可读、噪声较大且视觉异构性强,篇幅可达数十页,仅包含稀疏的任务相关信息。虽然近期的视觉语言模型在基准测试上取得优异性能,但直接端到端地将其应用于完整的财务报告,往往在现实条件下提取不可靠。我们提出一种多阶段抽取框架,集成图像预处理、多语言OCR、混合页面级检索以及紧凑型VLM驱动的结构化抽取。该设计将页面定位与多模态推理分离,使其能够从复杂多页面文档中实现更精确的抽取。在120份生产KYC文件(约3000页多语言扫描页面)上进行评估,实验结果表明,在多种OCR-VLM组合下,所提管道持续优于直接的PDF到VLM基线方法,字段级准确率提升最高可达31.9个百分点。最佳配置(PaddleOCR搭配MiniCPM2.6)达到87.27%的准确率。消融实验表明,页面级检索是性能提升的主要因素,尤其对于复杂财务报表和非英文文档效果显著。
引用
@article{arxiv.2604.26462,
title = {A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows},
author = {Yuxuan Han and Yuanxing Zhang and Yushuo Wang and Yichao Jin and Kenneth Zhu Ke and Jingyuan Zhao},
journal= {arXiv preprint arXiv:2604.26462},
year = {2026}
}