KhmerST:低资源柬埔寨场景文本检测与识别基准
计算机视觉与模式识别
2024-10-25 v1
摘要
开发有效的场景文本检测和识别模型依赖于大量训练数据,这对于低资源语言尤其昂贵且耗时。针对拉丁字符常规方法在非拉丁脚本上常常难以处理,由于面临字符堆叠、音节、可变字符宽度且缺乏清晰词边界等挑战。本文介绍首个柬埔寨场景文本数据集,包含1544幅专家标注图像,其中包括997幅室内和547幅室外场景。该数据集涵盖平面文本、浮雕文本、照明不足文本、远距离和部分遮挡文本。标注提供了行级文本和每幅场景的多边形边界框坐标。基准包括场景文本检测和识别的基线模型,为未来研究提供了稳健的起点。KhmerST数据集公开于https://gitlab.com/vannkinhnom123/khmerst
引用
@article{arxiv.2410.18277,
title = {KhmerST: A Low-Resource Khmer Scene Text Detection and Recognition Benchmark},
author = {Vannkinh Nom and Souhail Bakkali and Muhammad Muzzamil Luqman and Mickaël Coustaty and Jean-Marc Ogier},
journal= {arXiv preprint arXiv:2410.18277},
year = {2024}
}
备注
Accepted at ACCV 2024