中文

低资源情境下的巴哈纳语光学字符识别提升

计算与语言 2026-01-07 v1 计算机视觉与模式识别 机器学习

摘要

巴哈纳语(Bahnar)是一种分布在越南、柬埔寨和老挝的少数语言,由于缺乏研究和数据 availability,面临着显著的保存挑战。本研究 addresses 通过光学字符识别(OCR)技术实现巴哈纳语文档的准确数字化这一关键需求。扫描纸质文档的数字化面临着显著挑战,因图像质量下降导致的破损或模糊区域引入了大量OCR错误,妨碍信息检索系统的使用。我们提出了一种综合方法,结合高级表格和非表格检测技术与概率化后处理启发式方法来提高识别准确率。该方法首先应用检测算法改善输入数据质量,然后在OCR输出上采用概率化误差纠正。实验结果表明,识别准确率从72.86%显著提高到79.26%。本工作为巴哈纳语保存提供了宝贵资源,并为适用于其他少数语言数字化提供了框架。

关键词

引用

@article{arxiv.2601.02965,
  title  = {Low-Resource Heuristics for Bahnaric Optical Character Recognition Improvement},
  author = {Phat Tran and Phuoc Pham and Hung Trinh and Tho Quan},
  journal= {arXiv preprint arXiv:2601.02965},
  year   = {2026}
}