OmniOCR:面向少数民族语言的通用 OCR
计算机视觉与模式识别
2026-02-25 v1
摘要
OCR 随着深度学习和多模态模型的快速发展,但大多数方法仅关注拉丁文和中文等资源丰富的脚本。少数民族语言鲜有涉及,由于复杂的书写系统、稀缺的标注以及多样化的历史和现代形式,在低资源或零样本情形下的泛化性具有挑战性。为此,我们提出了 OmniOCR,一个面向少数民族脚本的通用框架。OmniOCR 引入 Dynamic Low-Rank Adaptation (Dynamic LoRA) 在层和脚本之间分配模型容量,实现有效的适应,同时保留知识。稀疏正则化修剪冗余更新,确保在不增加推理成本的情况下实现紧凑且高效的适应。评估在 TibetanMNIST、Shui、古老 Yi 文字和 Dongba 上的结果表明,OmniOCR 超越了零样本基础模型和标准 post-training 方法,实现了在参数效率更佳的情况下实现最先进的准确率;与最先进的基线模型相比,在这四个数据集上准确率提高了 39%-66%。代码:https://github.com/AIGeeksGroup/OmniOCR。
关键词
引用
@article{arxiv.2602.21042,
title = {OmniOCR: Generalist OCR for Ethnic Minority Languages},
author = {Bonan Liu and Zeyu Zhang and Bingbing Meng and Han Wang and Hanshuo Zhang and Chengping Wang and Daji Ergu and Ying Cai},
journal= {arXiv preprint arXiv:2602.21042},
year = {2026}
}