DohaScript:用于连续手写印地语文本的大规模多作者数据集
计算机视觉与模式识别
2026-02-23 v1 人工智能
机器学习
摘要
尽管印地语拥有数亿发言人,但手写 Devanagari 文本在公开可用的基准数据集中严重不足。现有资源规模有限,主要针对单独的字符或短词,缺乏受控的词汇内容和作者层面的多样性,这限制了其在现代数据驱动手写体分析中的实用性。因此,它们无法捕捉 Devanagari 手写体的连续、融合和结构复杂的本质,其中字符通过共享的 shirorekha(水平标题线)相连并呈现丰富的 ligature 形式。我们引入 DohaScript,这是一个来自 531 位独立作者的大规模、多作者手写印地语文本数据集。该数据集设计为平行的风格语料库,所有作者均转写相同的固定六个古典印地语 doha(成对的诗句)。这种受控设计使我们能够独立于语言内容进行系统性地分析作者特定的变异,并支持手写体识别、作者识别、风格分析和生成建模等任务。该数据集附带不可识别的民族统计信息、严格的质量筛选(基于客观的锐度和分辨率标准),以及页面级别的布局难度注释,促进分层基准测试。基线实验表明,数据集在质量分离方面表现明确,并对未见作者具有强大的泛化能力,凸显了数据集的可靠性和实际价值。DohaScript旨在作为推动低资源脚本下连续手写 Devanagari 文本研究的标准化和可重复基准。
关键词
引用
@article{arxiv.2602.18089,
title = {DohaScript: A Large-Scale Multi-Writer Dataset for Continuous Handwritten Hindi Text},
author = {Kunwar Arpit Singh and Ankush Prakash and Haroon R Lone},
journal= {arXiv preprint arXiv:2602.18089},
year = {2026}
}