基于多模态LLM的无上下文OCR:图像分辨率与视觉复杂度效应
计算机视觉与模式识别
2025-04-01 v1
摘要
由于其在图像描述、文档分析和自动内容生成等任务中高度灵活性,多模态大语言模型(multimodal Large Language Models, LLMs)已在多个行业领域引起广泛关注。尤其是它们在光学字符识别(Optical Character Recognition, OCR)方面已超越了专门模型。然而,针对不同图像条件下的表现仍未得到充分调查,且由于依赖上下文线索,个别字符识别并不得到保证。本文我们使用具有多样化视觉复杂度的单字符图像,探讨无上下文OCR任务,以确定准确识别的条件。我们的发现表明,多模态LLM在约300 ppi时可与传统OCR方法相匹配,而在低于150 ppi时性能显著下降。此外,我们观察到视觉复杂度与误识别之间的相关性非常弱,而传统OCR专用模型则没有相关性。这些结果表明,图像分辨率和视觉复杂度可能在需要精确字符级准确性的OCR任务中发挥重要作用。
引用
@article{arxiv.2503.23667,
title = {Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity},
author = {Kotaro Inoue},
journal= {arXiv preprint arXiv:2503.23667},
year = {2025}
}