使用多模态LLM进行历史文献中的手写识别
计算机视觉与模式识别
2024-11-01 v1
摘要
有大量的历史和文化文献仅以手写手稿的形式存在。与此同时,相对于印刷品数字化的过程,跨文字和不同手写风格执行光学字符识别(OCR)已被证明是一个极其困难的问题。虽然最近的基于Transformer的模型取得了相对较强的性能,但它们严重依赖人工转录的训练数据,并且难以在不同书写者之间泛化。多模态LLM,如GPT-4v和Gemini,已经展示了通过少样本提示执行OCR和计算机视觉任务的有效性。在本文中,我评估了Gemini生成的手写文档转录文本的准确性,并将其与当前最先进的基于Transformer的方法进行了比较。
引用
@article{arxiv.2410.24034,
title = {Handwriting Recognition in Historical Documents with Multimodal LLM},
author = {Lucian Li},
journal= {arXiv preprint arXiv:2410.24034},
year = {2024}
}