为何场景文本识别应使用真实数据
计算机视觉与模式识别
2021-07-30 v1
摘要
文本识别领域的近期工作将识别结果推向了新的高度。但长期以来,缺乏大规模人工标注的自然文本识别数据集一直迫使研究者使用合成数据训练文本识别模型。尽管合成数据集规模很大(最著名的两个合成数据集 MJSynth 和 SynthTest 各含数百万张图像),但与 ICDAR 等自然数据集相比,其多样性可能不足。幸运的是,近期发布的 OpenImages V5 数据集的文本识别标注在实例数量上可与合成数据集媲美,且样本更为多样。我们将该标注与 Yet Another Mask Text Spotter 的文本识别头架构结合使用,取得了与 SOTA 相当的结果。在部分数据集上我们甚至超越了此前的 SOTA 模型。本文还介绍了一个文本识别模型。该模型的代码已公开。
引用
@article{arxiv.2107.13938,
title = {Why You Should Try the Real Data for the Scene Text Recognition},
author = {Vladimir Loginov},
journal= {arXiv preprint arXiv:2107.13938},
year = {2021}
}