相机拍摄文档自动真值生成的通用方法
计算机视觉与模式识别
2016-05-05 v1
摘要
本文的贡献有四个方面。第一项贡献是一种新颖的、通用的相机拍摄文档图像(书籍、杂志、文章、发票等)自动真值生成方法。它使我们能够在无需任何人工干预的情况下构建大规模(即数百万图像)标注的相机拍摄/扫描文档数据集。该方法是通用的、语言无关的,可用于生成任何草写和非草写语言(例如英语、俄语、阿拉伯语、乌尔都语等)的标注文档数据集(扫描和相机拍摄均可)。为评估所提方法的有效性,使用该方法生成了英语和俄语的两个不同数据集。对两个数据集样本的评估显示,99:98%的图像被正确标注。第二项贡献是一个大规模的相机拍摄字符和单词图像数据集(称为C3Wi),包含100万词图像(1000万字符图像),通过真实的基于相机的采集捕获。该数据集可用于相机拍摄文档上字符识别系统的训练和测试。第三项贡献是一种用于识别相机拍摄文档图像的新颖方法。所提方法基于长短期记忆(Long Short-Term Memory, LSTM)并优于最先进的基于相机的OCR方法。作为第四项贡献,使用所提出的C3Wi数据集进行了各种基准测试,以揭示商业(ABBYY)、开源(Tesseract)和所提出的基于相机的OCR的行为。评估结果显示,现有的在扫描文档上已经获得非常高准确率的OCR,在相机拍摄文档图像上性能有限;其中ABBYY准确率为75%,Tesseract准确率为50.22%,而所提出的字符识别系统准确率为95.10%。
引用
@article{arxiv.1605.01189,
title = {A Generic Method for Automatic Ground Truth Generation of Camera-captured Documents},
author = {Sheraz Ahmed and Muhammad Imran Malik and Muhammad Zeshan Afzal and Koichi Kise and Masakazu Iwamura and Andreas Dengel and Marcus Liwicki},
journal= {arXiv preprint arXiv:1605.01189},
year = {2016}
}