IndicSTR12:一个用于印度语场景文本识别的数据集
计算机视觉与模式识别
2024-03-18 v1
摘要
场景文本识别(STR)在当今日益数字化的世界中的重要性怎么强调都不为过。鉴于 STR 的重要性,自动学习特征映射的数据密集型深度学习方法主要推动了 STR 解决方案的发展。为了满足这一需求,已有多个基准数据集和大量关于深度学习模型的工作可用于拉丁语言。然而,对于由 13 亿人使用和阅读的、在句法和语义上更复杂的印度语言,相关工作和可用数据集较少。本文旨在通过提出最大、最全面的真实数据集——IndicSTR12,并在 12 种主要印度语言上对 STR 性能进行基准测试,来解决印度语领域缺乏全面数据集的问题。已有少数工作解决了同样的问题,但据我们所知,它们只关注了少数几种印度语言。所提出数据集的大小和复杂性与现有的拉丁语同类数据集相当,而其多语言特性将促进鲁棒文本检测和识别模型的开发。该数据集是专门为一组使用不同文字的相关语言创建的。该数据集包含从各种自然场景中收集的超过 27000 个单词图像,每种语言超过 1000 个单词图像。与以往的数据集不同,这些图像涵盖了更广泛的现实条件,包括模糊、光照变化、遮挡、非图标文本、低分辨率、透视文本等。除了新数据集,我们还提供了在三个模型——PARSeq、CRNN 和 STARNet——上的高性能基线。
引用
@article{arxiv.2403.08007,
title = {IndicSTR12: A Dataset for Indic Scene Text Recognition},
author = {Harsh Lunia and Ajoy Mondal and C V Jawahar},
journal= {arXiv preprint arXiv:2403.08007},
year = {2024}
}