中文

净化明珠:基于 Google OCR 藏文手稿构建的神经拼写纠错模型

计算与语言 2026-05-19 v2 人工智能 计算机与社会 机器学习

摘要

人文学科学者在研究过去的历史、宗教和社会政治结构时严重依赖古代手稿。人们已投入大量精力利用 OCR 技术对这些珍贵手稿进行数字化,但由于大多数手稿在几个世纪中受损,光学字符识别 (OCR) 程序无法捕捉褪色的字迹和页面上的污渍。本工作提出了一种基于 Google OCR 藏文手稿构建的神经拼写纠错模型,用于自动纠正 OCR 产生的含噪输出。本文分为四个部分:数据集、模型架构、训练和分析。首先,我们将原始的藏文电子文本语料库进行特征工程处理,转化为两组结构化数据框——一组配对的玩具数据和一组配对的真实数据。然后,我们在 Transformer 架构中实现了置信度分数机制以执行拼写纠错任务。根据损失和字符错误率,我们的 Transformer + 置信度分数机制架构被证明优于 Transformer、LSTM-2-LSTM 和 GRU-2-GRU 架构。最后,为了检验模型的鲁棒性,我们分析了错误词元,并可视化了模型中的注意力和自注意力热图。

关键词

引用

@article{arxiv.2304.03427,
  title  = {Cleansing Jewel: A Neural Spelling Correction Model Built On Google OCR-ed Tibetan Manuscripts},
  author = {Queenie Luo and Yung-Sung Chuang},
  journal= {arXiv preprint arXiv:2304.03427},
  year   = {2026}
}