大型语言模型用于页面流分段
计算与语言
2024-08-23 v1
摘要
页面流分段(PSS)是大规模自动文档处理的关键前提,但其研究进展受限于缺乏真实公开基准数据集。本文通过引入TABME++增强基准数据集(包含商业光学字符识别OCR注释)来弥补这一不足。我们评估了大型语言模型(LLMs)在PSS任务中的性能,聚焦于使用参数高效方法微调的解码器模型。我们的结果表明,解码器模型的性能优于较小的多模态编码器。通过审查现有PSS研究和数据集, 我们识别出该领域的关键挑战和进展。我们的发现突显出对鲁健OCR的重要性,为开发更有效的文档处理系统提供了宝贵的见解。
引用
@article{arxiv.2408.11981,
title = {Large Language Models for Page Stream Segmentation},
author = {Hunter Heidenreich and Ratish Dalvi and Rohith Mukku and Nikhil Verma and Neven Pičuljan},
journal= {arXiv preprint arXiv:2408.11981},
year = {2024}
}