面向印度语言的 OCR 合成基准数据集
计算机视觉与模式识别
2022-05-06 v1
摘要
我们提出了目前公开可用的最大规模的面向印度语言的合成 OCR 基准数据集。该数据集包含 23 种印度语言共计 90k 张图像及其真值。印度语言的 OCR 模型验证需要处理大量多样化数据,以构建鲁棒且可靠的模型。否则生成如此海量的数据将十分困难,而借助合成数据则变得容易得多。这对于计算机视觉或图像处理等领域具有重要意义,一旦开发出初始合成数据,模型创建便会更为简便。合成数据的生成具备灵活调整其性质与环境的优势,可随时按需优化以提升模型性能。标注实时数据的精度有时代价高昂,而合成数据则能以良好得分轻松达到较高精度。
引用
@article{arxiv.2205.02543,
title = {OCR Synthetic Benchmark Dataset for Indic Languages},
author = {Naresh Saini and Promodh Pinto and Aravinth Bheemaraj and Deepak Kumar and Dhiraj Daga and Saurabh Yadav and Srihari Nagaraj},
journal= {arXiv preprint arXiv:2205.02543},
year = {2022}
}