为何不止于单词?通过行级OCR 揭示更大图景
计算机视觉与模式识别
2025-09-01 v1 人工智能
计算与语言
机器学习
摘要
传统的光学字符识别(OCR)技术对每个字符进行分割然后进行识别,这使得它们在字符分割容易出错,且缺乏利用语言模型的上下文。上世纪十年的序列到序列翻译进展导致现代技术首先检测单词,然后将每个单词输入模型,以字符序列的形式直接输出完整单词。这使得更好地利用语言模型,并绕过错误-prone的字符分割步骤。我们注意到,上述风格的转变将准确率的瓶颈移动到了单词分割。因此,在本文中,我们提出了从单词级OCR向行级OCR的自然且合乎逻辑的进阶。该方案允许绕过单词检测的错误,并为更好地利用语言模型提供更大的句子上下文。我们展示,所提出的技术不仅提高了准确率,也提高了OCR的效率。尽管我们进行了详尽的文献调查,但未发现任何公共数据集用于训练和评估从单词转向行级OCR的转移。因此,我们也贡献了一个精心挑选的251个英文页面图像的数据集,包含行级标注。我们的实验结果显示,端到端准确率提高了5.4%,凸显了向行级OCR转移潜在收益,特别是对于文档图像。我们还报告了与单词级管道相比效率提升了4倍。随着大型语言模型的持续改进,我们的方法也具有利用此类进展的潜力。项目网站: https://nishitanand.github.io/line-level-ocr-website
引用
@article{arxiv.2508.21693,
title = {Why Stop at Words? Unveiling the Bigger Picture through Line-Level OCR},
author = {Shashank Vempati and Nishit Anand and Gaurav Talebailkar and Arpan Garai and Chetan Arora},
journal= {arXiv preprint arXiv:2508.21693},
year = {2025}
}
备注
11 pages. Project Website: https://nishitanand.github.io/line-level-ocr-website