Ocean-OCR:面向通用OCR应用的视觉语言模型
计算机视觉与模式识别
2025-01-28 v1
摘要
多模态大语言模型(MLLM)在 various 领域展现出惊人的能力,尤其擅长处理和理解来自多个模态的信息。尽管此前取得了快速进展,但不足的OCR能力阻碍了MLLM在与文本相关的任务中大放异彩。本文提出了Ocean-OCR,这是一个3B参数的MLLM,在各种OCR场景中取得最先进的性能,并在一般任务上的理解能力与之相当。我们采用Native分辨率ViT以实现可变分辨率输入,并利用大量高质量OCR数据集来提升模型性能。我们通过在开源OCR基准测试和各种OCR场景上的全面实验,展示了Ocean-OCR的卓越性。这些场景包括文档理解、场景文本识别和手写体识别,凸显了Ocean-OCR强大的OCR能力。值得注意的是,Ocean-OCR是首个在专业OCR模型如TextIn和PaddleOCR上超越者的MLLM。
关键词
引用
@article{arxiv.2501.15558,
title = {Ocean-OCR: Towards General OCR Application via a Vision-Language Model},
author = {Song Chen and Xinyu Guo and Yadong Li and Tao Zhang and Mingan Lin and Dongdong Kuang and Youwei Zhang and Lingfeng Ming and Fengyu Zhang and Yuran Wang and Jianhua Xu and Zenan Zhou and Weipeng Chen},
journal= {arXiv preprint arXiv:2501.15558},
year = {2025}
}