HANA:一个用于离线手写文本识别的手写姓名数据库
计算机视觉与模式识别
2022-03-11 v2 计量经济学
摘要
用于跨历史数据集关联个体的方法(通常与基于人工智能的转录模型结合使用)正在快速发展。可能最为重要的关联标识符就是人名。然而,人名容易出现枚举和转录错误,尽管现代关联方法旨在应对此类挑战,但这些错误来源十分关键,应当尽量减少。为此,改进的转录方法和大规模数据库是关键组成部分。本文描述并提供了一份新构建的大规模数据库 HANA 的文档,该数据库包含超过 330 万个姓名。数据库含有超过 10.5 万个唯一姓名,总计超过 110 万张人名图像,这证明其对迁移学习到其他场景很有用。我们在此提供三个示例,在丹麦和美国人口普查数据上均获得了显著改善的转录准确率。此外,我们给出了深度学习模型从扫描文档中自动转录人名的基准结果。通过公开更具挑战性的大规模数据库,我们希望促进更精细、更准确、更鲁棒的手写文本识别模型的发展。
引用
@article{arxiv.2101.10862,
title = {HANA: A HAndwritten NAme Database for Offline Handwritten Text Recognition},
author = {Christian M. Dahl and Torben Johansen and Emil N. Sørensen and Simon Wittrock},
journal= {arXiv preprint arXiv:2101.10862},
year = {2022}
}