CENSUS-HWR:用于离线手写识别的大规模训练数据集
计算机视觉与模式识别
2024-09-02 v1 人工智能
摘要
自动化手写识别的进展一直受限于大规模训练数据集的缺乏。几乎所有研究都使用一组小型数据集,这常导致模型过拟合。我们提出 CENSUS-HWR,一个由 1,812,014 张灰度图像中的完整英文手写单词组成的新数据集。该集合包含来自英语中 10,711 个单词词汇表的共计 1,865,134 条手写文本。该数据集旨在作为深度学习算法的手写模型基准。这一庞大的英文手写识别数据集提取自美国 1930 和 1940 年人口普查,每年约由 70,000 名普查员记录。数据集及带权重的训练模型可在 https://censustree.org/data.html 免费下载。
引用
@article{arxiv.2305.16275,
title = {CENSUS-HWR: a large training dataset for offline handwriting recognition},
author = {Chetan Joshi and Lawry Sorenson and Ammon Wolfert and Mark Clement and Joseph Price and Kasey Buckles},
journal= {arXiv preprint arXiv:2305.16275},
year = {2024}
}