中文

使用多模态LLM进行历史文献中的手写识别

计算机视觉与模式识别 2024-11-01 v1

摘要

有大量的历史和文化文献仅以手写手稿的形式存在。与此同时,相对于印刷品数字化的过程,跨文字和不同手写风格执行光学字符识别(OCR)已被证明是一个极其困难的问题。虽然最近的基于Transformer的模型取得了相对较强的性能,但它们严重依赖人工转录的训练数据,并且难以在不同书写者之间泛化。多模态LLM,如GPT-4v和Gemini,已经展示了通过少样本提示执行OCR和计算机视觉任务的有效性。在本文中,我评估了Gemini生成的手写文档转录文本的准确性,并将其与当前最先进的基于Transformer的方法进行了比较。

关键词

引用

@article{arxiv.2410.24034,
  title  = {Handwriting Recognition in Historical Documents with Multimodal LLM},
  author = {Lucian Li},
  journal= {arXiv preprint arXiv:2410.24034},
  year   = {2024}
}