解密未被照顾的群体:低资源脚本 LLM OCR 的基准测试
机器学习
2024-12-23 v1 计算机视觉与模式识别
图像与视频处理
摘要
本研究探讨了大型语言模型(LLM),尤其是 GPT-4o,用于低资源脚本(如乌尔都语、阿尔巴尼亚语和塔吉克语)的光学字符识别(OCR),以英语作为基准。我们构建了包含 2,520 张图片的人工精选数据集,控制变量包括文本长度、字体大小、背景颜色和模糊度,以模拟多样化的真实场景。结果强调了零样本 LLM-based OCR 的局限性,尤其是对于语言复杂脚本,凸显了需要标注数据集和微调模型的必要性。本工作强调了 Addressing text digitization 中的可及性差距,为面向未被服务语言的包容性和稳健 OCR 解决方案铺平了道路。
引用
@article{arxiv.2412.16119,
title = {Deciphering the Underserved: Benchmarking LLM OCR for Low-Resource Scripts},
author = {Muhammad Abdullah Sohail and Salaar Masood and Hamza Iqbal},
journal= {arXiv preprint arXiv:2412.16119},
year = {2024}
}