基于图像处理与 Tesseract 的场景文本检测与识别
计算机视觉与模式识别
2020-04-20 v1
摘要
文本识别是计算机视觉中具有相当实际应用价值且具挑战性的任务之一。光学字符识别(OCR)可实现多种自动化应用。本项目聚焦于自然图像中的单词检测与识别。与扫描文档中的文本读取相比,所针对的问题明显更具挑战性。所关注的用例因可在受限条件下获取图像,从而能够更精确地检测自然场景中的文本区域。这是通过安装在卡车上的摄像头全天候捕获同类图像实现的。随后使用 Tesseract OCR 引擎对检测到的文本区域进行识别。尽管其具有低计算功耗要求的优势,该模型仅局限于特定用例。本文讨论了测试中出现的一种关键误检(假阳性)情形,并详述了缓解该问题的策略。该项目实现了超过 80% 的正确字符识别率。本文概述了开发阶段、主要挑战及项目中一些有趣的发现。
引用
@article{arxiv.2004.08079,
title = {Image Processing Based Scene-Text Detection and Recognition with Tesseract},
author = {Ebin Zacharias and Martin Teuchler and Bénédicte Bernier},
journal= {arXiv preprint arXiv:2004.08079},
year = {2020}
}
备注
6 pages, 4 figures