中文

GPT-4用于文档理解的适用性笔记

计算与语言 2024-05-29 v1

摘要

我们对GPT-4系列所有公开可用模型进行了遗漏的、可重复的评估,关注文档理解领域,该领域常需理解文本空间布局和视觉线索以及文本语义。基准结果表明,尽管文本模型难以获得令人满意的结果,GPT-4 Vision Turbo在提供由外部OCR引擎识别的文本和文档图像输入时表现良好。评估后续分析表明,文本GPT-4模型可能受到文本污染,且在长文档上性能显著下降。

关键词

引用

@article{arxiv.2405.18433,
  title  = {Notes on Applicability of GPT-4 to Document Understanding},
  author = {Łukasz Borchmann},
  journal= {arXiv preprint arXiv:2405.18433},
  year   = {2024}
}