中文

CHURRO:基于开源权重大视觉语言模型实现高精度低成本历史文本识别,让历史文本变得可读

计算与语言 2025-09-25 v1 计算机视觉与模式识别

摘要

准确的历史文档文本识别可以极大地推动文化遗产的研究与保护。然而,现有的视觉语言模型(VLM)是为现代标准化文本设计的,无法应对历史材料中常见的多种语言与文字、不规则版式以及频繁退化等问题。本文提出了CHURRO,一个专为历史文本识别设计的3B参数开源权重VLM。该模型在CHURRO-DS数据集上进行训练,这是迄今为止最大的历史文本识别数据集。CHURRO-DS统一了155个历史语料库,涵盖99,491页,跨越22个世纪的文本遗产,涉及46个语言簇,包括历史变体和死语言。我们在CHURRO-DS上对多个开源与闭源VLM以及光学字符识别(OCR)系统进行了评估,发现CHURRO优于所有其他VLM。在CHURRO-DS测试集上,CHURRO实现了82.3%(印刷体)和70.1%(手写体)的归一化Levenshtein相似度,分别超越第二优模型Gemini 2.5 Pro达1.4%和6.5%,同时成本效益高出15.5倍。通过发布模型与数据集,我们旨在推动社区驱动的研究以改善历史文本的可读性并加速学术研究。

关键词

引用

@article{arxiv.2509.19768,
  title  = {CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition},
  author = {Sina J. Semnani and Han Zhang and Xinyan He and Merve Tekgürler and Monica S. Lam},
  journal= {arXiv preprint arXiv:2509.19768},
  year   = {2025}
}

备注

EMNLP 2025