中文

通过封面判断书籍:探索多模态大语言模型用于多页手写文档转录

机器学习 2026-04-21 v2 人工智能 计算机视觉与模式识别

摘要

手写体文本识别(HTR)仍是一个具有挑战性的任务。现有方法需要针对标记数据进行微调,而这在实际问题中难以获得,或依赖于零样本工具,如 OCR 引擎和多模态大语言模型(MLLMs)。MLLMs 作为端到端转录器和 OCR 后处理器均显示出前景,但迄今为止,针对 HTR 不同 MLLM 提示策略的实证研究仍很少,特别是针对多页文档的情况。大多数手写文档是多页的,并且在语义内容和手写体样式方面共享上下文,但 MLLMs 通常仅用于逐页转录,这意味着会丢弃这种共享上下文。它们也通常被用作文本-only 后处理器或图像-only OCR 替代方案,而不是充分利用多模态。本文研究了结合 OCR、LLM 后处理和 MLLM 端到端转录的多种方法,用于零样本多页手写文档转录任务。我们从现有的单页数据集中引入了该任务的基准,包括一个新数据集 Malvern-Hills。最后,我们引入了 OCR+PAGE-1 和 OCR+PAGE-N 两种提示策略,通过在多页之间共享内容来最小化提示复杂度,显著优于现有方法。

关键词

引用

@article{arxiv.2502.20295,
  title  = {Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription},
  author = {Benjamin Gutteridge and Matthew Thomas Jackson and Toni Kukurin and Xiaowen Dong},
  journal= {arXiv preprint arXiv:2502.20295},
  year   = {2026}
}

备注

9 pages (34 including references and appendices), 11 figures, earlier version accepted at AAAI-25 Workshop on Document Understanding and Intelligence