手写数字串识别端到端方法的综合比较
计算机视觉与模式识别
2020-11-02 v1
摘要
在过去的几十年中,大多数针对手写数字串识别(HDSR)提出的方法都借助于数字分割,而分割主要由启发式规则主导,从而对最终性能施加了 substantial 约束。其中少数基于无分割策略,即每一像素列都有一个潜在的切分位置。近来,无分割策略为该问题增添了另一视角,取得了有前景的结果。然而,这些策略在处理大量粘连数字时仍表现出一些局限性。为弥补由此产生的差距,本文中我们假设数字串可被视为一系列对象。因此我们评估了不同的端到端方法来解决 HDSR 问题,特别是在两个方向上:基于目标检测的(例如 Yolo 和 RetinaNet)以及基于序列到序列表示的(CRNN)。本工作的主要贡献在于提供了在上述五种常用于评估 HDSR 的基准上的综合比较与批判性分析,包括具有挑战性的 Touching Pair 数据集、NIST SD19,以及为 ICFHR 2014 HDSR 竞赛提出的两种真实世界数据集(CAR 和 CVL)。我们的结果表明,Yolo 模型相较于无分割模型具有优势,其流水线更短,最大限度减少了基于启发式模型的存在,因而表现更优。它在 NIST-SD19、CAR 和 CVL 数据集上分别取得了 97%、96% 和 84% 的识别率。
引用
@article{arxiv.2010.15904,
title = {A Comprehensive Comparison of End-to-End Approaches for Handwritten Digit String Recognition},
author = {Andre G. Hochuli and Alceu S. Britto and David A. Saji and Jose M. Saavedra and Robert Sabourin and Luiz S. Oliveira},
journal= {arXiv preprint arXiv:2010.15904},
year = {2020}
}