基于 LLM 的财政文件信息抽取
计算与语言
2025-11-25 v2 信息检索
摘要
大语言模型 (LLM) 在文本理解方面展现了惊人的能力,但其处理复杂层次化表格数据的能力尚未得到充分探索。我们提出一种新方法,用于从多页政府财政文件中抽取结构化数据。该方法应用于印度卡纳塔邦的年度财政文件(200 多页),通过多阶段管道实现高准确率,利用领域知识、顺序语境和算法验证。传统 OCR 方法的一个主要挑战是无法验证数字的准确抽取。在财政数据应用中,财政表格的内在结构——即各层级总计位于层级总计位置——允许对抽取数据进行稳健的内部验证。我们利用这些层级关系创建了多级验证检查。我们展示了 LLM 能够读取表格并处理文档特定的结构层级,为将 PDF 基于财政披露转换为研究就绪数据库提供了可扩展的流程。我们的实现在发展中地区的更广泛应用中显示出前景。
引用
@article{arxiv.2511.10659,
title = {Information Extraction From Fiscal Documents Using LLMs},
author = {Vikram Aggarwal and Jay Kulkarni and Aditi Mascarenhas and Aakriti Narang and Siddarth Raman and Ajay Shah and Susan Thomas},
journal= {arXiv preprint arXiv:2511.10659},
year = {2025}
}
备注
6 pages. Presented at the AI for Financial Inclusion, Risk Modeling and Resilience in Emerging Markets workshop at ACM ICAIF 2025 Singapore