中文

自动发票数据提取:基于大语言模型和光学字符识别

计算机视觉与模式识别 2026-01-09 v2 人工智能

摘要

传统的光学字符识别(OCR)系统面临着单张发票布局变异、手写文字以及低质量扫描件带来的挑战,这些挑战往往由强模板依赖导致,其灵活性受限于不同的文档结构和布局。 newer解决方案利用卷积神经网络(CNN)以及Transformer等先进深度学习模型,以及特定领域模型,以实现对各种文档类型的布局分析和准确率提升。大语言模型(LLM)凭借其精妙的实体识别和语义理解能力,彻底革新了提取管道的核心,支持复杂的上下文关系映射,而无需直接编程规范。视觉命名实体识别(NER)能力使得从发票图像中提取具有更大的上下文灵敏性和较高的准确率。现行行业最佳实践采用混合架构,将OCR技术与LLM融合,以实现最大可扩展性和最小人工干预。本工作引入了一个整合了OCR、深度学习、LLM和图分析的全方位人工智能平台,以实现前所未有的提取质量和一致性。

关键词

引用

@article{arxiv.2511.05547,
  title  = {Automated Invoice Data Extraction: Using LLM and OCR},
  author = {Khushi Khanchandani and Advait Thakur and Akshita Shetty and Chaitravi Reddy and Ritisa Behera},
  journal= {arXiv preprint arXiv:2511.05547},
  year   = {2026}
}

备注

10 pages, 3 figures