中文

大型语言模型手写体识别基准测试

计算机视觉与模式识别 2025-06-24 v3

摘要

传统的手写体识别(HTR)机器学习模型依赖监督式训练,需要大量手动标注,且常因布局与文本处理的分离而产生错误。相比之下,多模态大型语言模型(MLLMs)提供了一种无需模型特定训练即可识别多样手写体风格的通用方法。该研究对比评估了各种专有和开源 LLM 与 Transkribus 模型的性能,在由英语、法语、德语和意大利语撰写的现代和历史数据集上进行测试。此外,强调测试模型在自主纠正先前生成输出方面的能力。研究结果表明,专有模型,尤其是 Claude 3.5 Sonnet,在零样本设置下优于开源替代方案。MLLMs 在识别现代手写体方面取得优异成绩,并因其预训练数据集构成而偏好英语语言。与 Transkribus 的比较显示,两种方法并无一致优势。此外,LLMs 在零样本转录纠错方面表现有限。

关键词

引用

@article{arxiv.2503.15195,
  title  = {Benchmarking Large Language Models for Handwritten Text Recognition},
  author = {Giorgia Crosilla and Lukas Klic and Giovanni Colavizza},
  journal= {arXiv preprint arXiv:2503.15195},
  year   = {2025}
}