中文

OCR时不时?在大规模真实数据驱动下重新思考多模态大语言模型时代的文档信息抽取

计算与语言 2026-03-04 v1 人工智能

摘要

多模态大语言模型(MLLMs)提升了自然语言处理的潜力,但其对文档信息抽取的实际影响尚不明确。尤其难以判断,仅使用MLLM的管道——尽管更为简洁——是否能够真正达到传统OCR+MLLM方案的性能。本文我们开展了大规模基准测试研究,对various可直接使用的MLLMs在商业文档信息抽取任务上进行评估。为检验和探索失败模式,我们提出了一种自动化的分层错误分析框架,利用大语言模型(LLMs)系统性地诊断错误模式。我们的发现表明,OCR可能并非必需,强大的MLLMs通过仅使用图像输入即可实现与OCR增强方法相当的性能。此外,我们展示,经过精心设计的模式、示例和指令可以进一步提升MLLMs的性能。我们希望本工作能为文档信息抽取提供实际指导和宝贵洞见。

关键词

引用

@article{arxiv.2603.02789,
  title  = {OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets},
  author = {Jiyuan Shen and Peiyue Yuan and Atin Ghosh and Yifan Mai and Daniel Dahlmeier},
  journal= {arXiv preprint arXiv:2603.02789},
  year   = {2026}
}