中文

无真值材料下的手写文本识别模型评估

计算与语言 2022-05-02 v2

摘要

在开发过程中评估手写文本识别(Handwritten Text Recognition, HTR)模型是直接的:由于 HTR 是一个有监督问题,通常将数据集划分为训练、验证和测试集,便可依据准确率或错误率对模型进行评估。然而,一旦从开发转向应用,评估过程就变得棘手。从我们欲应用模型的数据样本中编制一个新的(且必然更小的)真值(Ground Truth, GT)集,并随后在其上评估模型,仅能提供关于识别文本质量的线索,模型返回的置信度分数(若可用)亦然。此外,若我们手头有多个模型,便会面临模型选择问题,因为我们希望在应用阶段获得尽可能最佳的结果。这呼唤无需 GT 的度量来挑选最佳模型,因此我们(重新)引入并比较了不同度量,从简单的基于词典的方法,到使用标准语言模型与掩码语言模型(masked language models, MLM)的更精细方法。我们表明,基于 MLM 的评估可与基于词典的方法相媲美,其优势在于大型多语言 transformer 随时可用,从而使得为其他度量编制词典资源变得多余。

关键词

引用

@article{arxiv.2201.06170,
  title  = {Evaluation of HTR models without Ground Truth Material},
  author = {Phillip Benjamin Ströbel and Simon Clematide and Martin Volk and Raphael Schwitter and Tobias Hodel and David Schoch},
  journal= {arXiv preprint arXiv:2201.06170},
  year   = {2022}
}

备注

Accepted at LREC 2022. Final version submitted to LREC 2022