利用语言模型改进PyLaia开源库中的自动文本识别
计算机视觉与模式识别
2024-04-30 v1 计算与语言
摘要
PyLaia是最流行的自动文本识别(ATR)开源软件之一,在速度和准确性方面表现出色。在本文中,我们概述了最近对PyLaia库的贡献,重点是在解码过程中引入可靠的置信度分数和集成统计语言模型。我们的实现提供了一种简单的方法,将PyLaia与不同级别的n-gram语言模型结合。这项工作的亮点之一是语言模型完全自动调优:无需任何专业知识,也无需额外数据,即可轻松构建和使用。为了展示我们贡献的重要性,我们在十二个数据集上评估了PyLaia在有和没有语言模型情况下的性能。结果表明,使用小型语言模型解码平均将词错误率降低了13%,字符错误率降低了12%。此外,我们对置信度分数进行了分析,并强调了校准技术的重要性。我们的实现已在官方PyLaia仓库(https://gitlab.teklia.com/atr/pylaia)中公开,并在Hugging Face上发布了十二个开源模型。
引用
@article{arxiv.2404.18722,
title = {Improving Automatic Text Recognition with Language Models in the PyLaia Open-Source Library},
author = {Solène Tarride and Yoann Schneider and Marie Generali-Lince and Mélodie Boillet and Bastien Abadie and Christopher Kermorvant},
journal= {arXiv preprint arXiv:2404.18722},
year = {2024}
}