中文

古老但已数字化:通过创建KHAMIS数据集开发东叙利亚文手写光学字符识别

计算机视觉与模式识别 2024-08-27 v1 计算与语言

摘要

许多语言拥有大量的手写文本,例如关于民间故事和历史叙事的古代手稿或当代文件和信件。这些文本的数字化具有多种应用,例如日常任务、文化研究和历史研究。叙利亚语是一种古老、濒危且资源匮乏的语言,尚未得到其所需和应得的关注。本文报告了一个研究项目,旨在开发一个基于手写叙利亚文本的光学字符识别(OCR)模型,作为为这种濒危语言构建更多数字服务的起点。我们创建了一个数据集KHAMIS(灵感来自东叙利亚诗人Khamis bar Qardahe),该数据集包含东叙利亚文手写句子。我们使用它来微调Tesseract-OCR引擎预训练的叙利亚语模型,使其适应手写数据。数据收集自能够读写该语言的志愿者,以创建KHAMIS。KHAMIS目前包含从31名大学生和一名教授处收集的624个手写叙利亚语句子,该数据集将部分在线提供,整个数据集将在不久的将来提供,用于开发和研究目的。结果,手写OCR模型在训练集和评估集上分别实现了1.097-1.610%和8.963-10.490%的字符错误率,在测试集上评估时,字符错误率为18.89-19.71%,词错误率为62.83-65.42%,比Tesseract的默认叙利亚语模型好两倍。

关键词

引用

@article{arxiv.2408.13631,
  title  = {Ancient but Digitized: Developing Handwritten Optical Character Recognition for East Syriac Script Through Creating KHAMIS Dataset},
  author = {Ameer Majeed and Hossein Hassani},
  journal= {arXiv preprint arXiv:2408.13631},
  year   = {2024}
}

备注

15 pages, 12 figures, 5 tables