场景文本识别模型比较出了什么问题?数据集与模型分析
计算机视觉与模式识别
2019-12-19 v4
摘要
近年来提出了许多场景文本识别(STR)模型的新方案。虽然各自声称推动了技术边界,但由于训练与评估数据集选择的不一致,该领域总体上缺乏公正且全面的比较。本文以三项主要贡献解决此困难。首先,我们考察了训练与评估数据集的不一致性,以及由不一致导致的性能差距。其次,我们引入了一个统一的四阶段 STR 框架,多数现有 STR 模型可归入其中。利用该框架可对先前提出的 STR 模块进行广泛评估,并发现此前未探索的模块组合。第三,在一组一致的训练与评估数据集下,我们从准确率、速度和内存需求方面分析各模块对性能的贡献。此类分析清除了当前比较中的障碍,以理解现有模块的性能提升。
引用
@article{arxiv.1904.01906,
title = {What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis},
author = {Jeonghun Baek and Geewook Kim and Junyeop Lee and Sungrae Park and Dongyoon Han and Sangdoo Yun and Seong Joon Oh and Hwalsuk Lee},
journal= {arXiv preprint arXiv:1904.01906},
year = {2019}
}
备注
Oral paper at ICCV'19. Our code is publicly available. (https://github.com/clovaai/deep-text-recognition-benchmark)