中文

历史资产负债表数据的数字化:实践者指南

计算机视觉与模式识别 2023-09-21 v2 综合经济学 经济学

摘要

本文讨论了如何通过用前处理和后处理方法增强光学字符识别(OCR)引擎,来成功数字化大规模历史微观数据。尽管由于机器学习的进步,OCR软件近年来有了显著改进,但现成的OCR应用仍存在较高的错误率,限制了其在精确提取结构化信息方面的应用。然而,用额外方法补充OCR可以大幅提高成功率,使其成为经济史学家强大且具成本效益的工具。本文展示了这些方法并解释了它们为何有用。我们将其应用于两个大型资产负债表数据集,并介绍了quipucamayoc,一个将这些方法包含在统一框架中的Python包。

关键词

引用

@article{arxiv.2204.00052,
  title  = {Digitizing Historical Balance Sheet Data: A Practitioner's Guide},
  author = {Sergio Correia and Stephan Luck},
  journal= {arXiv preprint arXiv:2204.00052},
  year   = {2023}
}

备注

For associated Github repository, see https://github.com/sergiocorreia/quipucamayoc/