中文

KhmerST:低资源柬埔寨场景文本检测与识别基准

计算机视觉与模式识别 2024-10-25 v1

摘要

开发有效的场景文本检测和识别模型依赖于大量训练数据,这对于低资源语言尤其昂贵且耗时。针对拉丁字符常规方法在非拉丁脚本上常常难以处理,由于面临字符堆叠、音节、可变字符宽度且缺乏清晰词边界等挑战。本文介绍首个柬埔寨场景文本数据集,包含1544幅专家标注图像,其中包括997幅室内和547幅室外场景。该数据集涵盖平面文本、浮雕文本、照明不足文本、远距离和部分遮挡文本。标注提供了行级文本和每幅场景的多边形边界框坐标。基准包括场景文本检测和识别的基线模型,为未来研究提供了稳健的起点。KhmerST数据集公开于https://gitlab.com/vannkinhnom123/khmerst

关键词

引用

@article{arxiv.2410.18277,
  title  = {KhmerST: A Low-Resource Khmer Scene Text Detection and Recognition Benchmark},
  author = {Vannkinh Nom and Souhail Bakkali and Muhammad Muzzamil Luqman and Mickaël Coustaty and Jean-Marc Ogier},
  journal= {arXiv preprint arXiv:2410.18277},
  year   = {2024}
}

备注

Accepted at ACCV 2024