中文

开发并使用机器学习模型自动转写 230 万手写职业代码的经验教训

机器学习 2022-01-07 v2

摘要

机器学习方法在文本识别上可达到高准确率,因此日益被用于手写历史文献的转写。然而,在生产环境中使用机器学习需要一条可扩展到数据集规模的端到端流水线,以及一个仅用少量人工转写即可达到高准确率的模型。模型结果的正确性也必须被验证。本文描述了我们在开发、调优和使用 Occode 端到端机器学习流水线以转写挪威 1950 年人口普查中 230 万手写职业代码过程中的经验教训。我们对自动转写代码达到了 97% 的准确率,并将 3% 的代码送交人工核验。我们验证了结果中的职业代码分布与训练数据中的分布一致,而后者应可代表整体普查情况。我们相信我们的方法与经验教训或有益于其他计划在生产中使用机器学习的转写项目。源代码见:https://github.com/uit-hdl/rhd-codes

关键词

引用

@article{arxiv.2106.03996,
  title  = {Lessons learned developing and using a machine learning model to automatically transcribe 2.3 million handwritten occupation codes},
  author = {Bjørn-Richard Pedersen and Einar Holsbø and Trygve Andersen and Nikita Shvetsov and Johan Ravn and Hilde Leikny Sommerseth and Lars Ailo Bongo},
  journal= {arXiv preprint arXiv:2106.03996},
  year   = {2022}
}