基于OCR和紧凑型视觉语言模型的金融文档多阶段字段提取
信息检索
2025-10-28 v1
摘要
金融文档是监管机构、审计人员和金融机构评估中小企业财富和合规性的重要信息来源。然而,中小企业文档往往难以解析,通常以扫描图像形式分发,机器不可读。扫描图像分辨率低,受倾斜或旋转影响,常包含噪声背景。这些文档还倾向于异质,混合叙述性内容、表格、图形和多语言文本于同一报告。这些特征为自动信息提取带来重大挑战,尤其是依赖端到端的大型视觉语言模型,因计算开销大、对噪声敏感、处理大量页面时速度慢。我们提出一种多阶段管道,利用传统图像处理模型和OCR提取技术,结合紧凑型视觉语言模型进行大规模金融文档的结构化字段提取。该方法从图像预处理(包括分割、方向检测和大小归一化)开始。随后应用多语言OCR恢复页面级文本。通过分析文本信息,检索出连贯的章节。最后,在这些缩小的范围内运行紧凑型视觉语言模型,以提取结构化金融指标。我们使用内部的多语言扫描金融文档语料库进行评估。结果表明,紧凑型视觉语言模型与多阶段管道相结合,相较于直接将整个文档输入大型视觉语言模型,仅需0.7%的GPU成本和92.6%更少的端到端服务延迟,即可实现字段级准确率提升8.8倍。
引用
@article{arxiv.2510.23066,
title = {Multi-Stage Field Extraction of Financial Documents with OCR and Compact Vision-Language Models},
author = {Yichao Jin and Yushuo Wang and Qishuai Zhong and Kent Chiu Jin-Chun and Kenneth Zhu Ke and Donald MacDonald},
journal= {arXiv preprint arXiv:2510.23066},
year = {2025}
}