中文

提升自动转录表格数据的手工复核效率

机器学习 2023-06-29 v1 计算机视觉与模式识别 人机交互

摘要

机器学习方法已被证明在转录历史数据方面有用。然而,即便高精度方法的结果也需人工核验与修正。此类人工复核可能耗时且昂贵,因此本文旨在提升其效率。此前,我们使用机器学习以高准确率(97%)转录了挪威 1950 年人口普查中 230 万手写职业代码。我们手工复核了 90,000(3%)模型置信度最低的代码。我们将这 90,000 个代码分配给人工复核者,他们使用我们的标注工具进行复核。为评估复核者一致性,部分代码被分配予多名复核者。随后我们分析复核结果以理解准确率提升与工作量间的关系。此外,我们访谈复核者以改进工作流。复核者修正了 62.8% 的标签,并在 31.9% 的情况下认同模型标签。约 0.2% 的图像无法赋予标签,而 5.1% 情况下复核者不确定或赋予了无效标签。9,000 张图像由多名复核者独立复核,一致率为 86.43%、不一致率为 8.96%。我们了解到,自动转录偏向于最常见代码,对最低频代码的误分类程度更高。访谈发现,复核者进行了内部质量控制,并认为我们的定制工具十分适用。因此只需一名复核者,但其应报告不确定性。

关键词

引用

@article{arxiv.2306.16126,
  title  = {More efficient manual review of automatically transcribed tabular data},
  author = {Bjørn-Richard Pedersen and Rigmor Katrine Johansen and Einar Holsbø and Hilde Sommerseth and Lars Ailo Bongo},
  journal= {arXiv preprint arXiv:2306.16126},
  year   = {2023}
}

备注

19 pages, 5 figures, 1 table