中文

探索 GPT-4V(ision) 的 OCR 能力:一项定量与深入评估

计算机视觉与模式识别 2023-10-31 v2

摘要

本文对近期发布的 Large Multimodal Model (LMM,大型多模态模型) GPT-4V(ision) 的光学字符识别(OCR)能力进行了全面评估。我们评估了该模型在一系列 OCR 任务上的表现,包括场景文本识别、手写文本识别、手写数学表达式识别、表格结构识别以及从视觉丰富文档中提取信息。评估显示,GPT-4V 在识别和理解拉丁语内容方面表现良好,但在多语言场景和复杂任务上表现吃力。具体而言,其在处理非拉丁语言以及诸如手写数学表达式识别、表格结构识别、文档图像端到端语义实体识别与配对抽取等复杂任务时表现出局限性。基于这些观察,我们确认专用 OCR 模型研究的必要性与持续价值。总体而言,尽管 GPT-4V 在处理多样化 OCR 任务时具有通用性,其并未超越现有最先进的 OCR 模型。如何充分利用诸如 GPT-4V 这类预训练通用 LMM 用于 OCR 下游任务仍是一个开放问题。本研究为未来基于 LMM 的 OCR 研究提供了关键参考。评估流程与结果可在 https://github.com/SCUT-DLVCLab/GPT-4V_OCR 获取。

关键词

引用

@article{arxiv.2310.16809,
  title  = {Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation},
  author = {Yongxin Shi and Dezhi Peng and Wenhui Liao and Zening Lin and Xinhong Chen and Chongyu Liu and Yuyi Zhang and Lianwen Jin},
  journal= {arXiv preprint arXiv:2310.16809},
  year   = {2023}
}