GPT-4用于文档理解的适用性笔记
计算与语言
2024-05-29 v1
摘要
我们对GPT-4系列所有公开可用模型进行了遗漏的、可重复的评估,关注文档理解领域,该领域常需理解文本空间布局和视觉线索以及文本语义。基准结果表明,尽管文本模型难以获得令人满意的结果,GPT-4 Vision Turbo在提供由外部OCR引擎识别的文本和文档图像输入时表现良好。评估后续分析表明,文本GPT-4模型可能受到文本污染,且在长文档上性能显著下降。
引用
@article{arxiv.2405.18433,
title = {Notes on Applicability of GPT-4 to Document Understanding},
author = {Łukasz Borchmann},
journal= {arXiv preprint arXiv:2405.18433},
year = {2024}
}