中文

大型语言模型用于页面流分段

计算与语言 2024-08-23 v1

摘要

页面流分段(PSS)是大规模自动文档处理的关键前提,但其研究进展受限于缺乏真实公开基准数据集。本文通过引入TABME++增强基准数据集(包含商业光学字符识别OCR注释)来弥补这一不足。我们评估了大型语言模型(LLMs)在PSS任务中的性能,聚焦于使用参数高效方法微调的解码器模型。我们的结果表明,解码器模型的性能优于较小的多模态编码器。通过审查现有PSS研究和数据集, 我们识别出该领域的关键挑战和进展。我们的发现突显出对鲁健OCR的重要性,为开发更有效的文档处理系统提供了宝贵的见解。

关键词

引用

@article{arxiv.2408.11981,
  title  = {Large Language Models for Page Stream Segmentation},
  author = {Hunter Heidenreich and Ratish Dalvi and Rohith Mukku and Nikhil Verma and Neven Pičuljan},
  journal= {arXiv preprint arXiv:2408.11981},
  year   = {2024}
}