面向提格里尼亚语印刷文本识别的 TrOCR 适配:面向跨文字迁移学习的词感知损失加权
计算机视觉与模式识别
2026-04-23 v1
摘要
基于 Transformer 的 OCR 模型在拉丁文字和中日韩文字上表现出色,但其在非洲音节书写系统中的应用仍然有限。我们首次将 TrOCR 适配于使用吉兹文字的提格里尼亚语印刷文本。从预训练模型出发,我们将字节级 BPE 分词器扩展至覆盖 230 个吉兹字符,并引入词感知损失加权(Word-Aware Loss Weighting),以解决将基于拉丁文的 BPE 惯例应用于新文字时出现的系统性词边界失效问题。未经修改的模型在吉兹文本上无法产生可用输出。适配后,TrOCR-Printed 变体在来自 GLOCR 数据集的 5,000 张合成图像构成的保留测试集上,实现了 0.22% 的字符错误率和 97.20% 的精确匹配准确率。消融研究证实,词感知损失加权是关键组件,与仅扩展词表相比,将字符错误率降低了两个数量级。完整流程可在单块 8 GB 消费级 GPU 上于三小时内完成训练。所有代码、模型权重和评估脚本均已公开发布。
引用
@article{arxiv.2604.20813,
title = {Adapting TrOCR for Printed Tigrinya Text Recognition: Word-Aware Loss Weighting for Cross-Script Transfer Learning},
author = {Yonatan Haile Medhanie and Yuanhua Ni},
journal= {arXiv preprint arXiv:2604.20813},
year = {2026}
}
备注
Code and models available at https://github.com/YoHa2024NKU/Tigrinya_TrOCR_Printed Pre-trained models: https://huggingface.co/Yonatanhaile2026/tigrinya-trocrprinted, https://huggingface.co/Yonatanhaile2026/tigrinya-trocrhandwritten