中文

OCRBench:大型多模态模型中OCR的隐藏奥秘

计算机视觉与模式识别 2024-12-17 v7 计算与语言

摘要

大型模型近期在自然语言处理与多模态视觉-语言学习中占据主导地位。然而,它们在文本相关视觉任务中的有效性仍相对未被充分探索。本文中,我们对大型多模态模型(如GPT4V与Gemini)在各种文本相关视觉任务中进行了综合评估,包括文本识别、场景文本中心视觉问答(VQA)、文档导向VQA、关键信息抽取(KIE)与手写数学表达式识别(HMER)。为促进对大型多模态模型中光学字符识别(OCR)能力的评估,我们提出OCRBench,一个综合评估基准。OCRBench包含29个数据集,使其成为现有最全面的OCR评估基准。此外,我们的研究揭示了这些模型的优势与弱点,特别是在处理多语言文本、手写文本、非语义文本与数学表达式识别方面。最重要的是,本研究的基线结果可为针对增强零样本多模态技术的创新策略的构思与评估提供基础框架。评估流程与基准可在 https://github.com/Yuliang-Liu/MultimodalOCR 获取。

关键词

引用

@article{arxiv.2305.07895,
  title  = {OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models},
  author = {Yuliang Liu and Zhang Li and Mingxin Huang and Biao Yang and Wenwen Yu and Chunyuan Li and Xucheng Yin and Cheng-lin Liu and Lianwen Jin and Xiang Bai},
  journal= {arXiv preprint arXiv:2305.07895},
  year   = {2024}
}