重新审视N-gram模型:其在现代手写文本识别神经网络中的影响
计算机视觉与模式识别
2024-05-01 v1 计算与语言
摘要
在自动文本识别的最新进展中,深度神经网络已经展示了隐式捕获语言统计信息的能力,可能减少对传统语言模型的需求。本研究直接探讨显式语言模型(特别是n-gram模型)是否仍然有助于手写识别领域最先进深度学习架构的性能。我们评估了两种突出的神经网络架构PyLaia和DAN,在集成和不集成显式n-gram语言模型的情况下的表现。我们在三个数据集(IAM、RIMES和NorHand v2)上进行了行级和页面级实验,研究了n-gram模型的最优参数,包括其阶数、权重、平滑方法和分词级别。结果表明,在所有数据集上,结合字符或子词n-gram模型显著提升了自动文本识别模型的性能,挑战了仅靠深度学习模型即可达到最优性能的观点。特别是,DAN与字符语言模型的组合超越了当前基准,证实了混合方法在现代文档分析系统中的价值。
引用
@article{arxiv.2404.19317,
title = {Revisiting N-Gram Models: Their Impact in Modern Neural Networks for Handwritten Text Recognition},
author = {Solène Tarride and Christopher Kermorvant},
journal= {arXiv preprint arXiv:2404.19317},
year = {2024}
}