中文

SiDiaC:僧伽罗语历时语料库

计算与语言 2026-05-19 v2

摘要

SiDiaC 是首个全面的僧伽罗语历时语料库,覆盖了从公元 5 世纪到 20 世纪的历史跨度。SiDiaC 包含 46 部文学作品中的 58k 个词,在经过可用性、作者身份、版权合规和数据归属的筛选后,根据书写日期进行了仔细标注。国家图书馆的斯里兰卡文献通过 Google Document AI OCR 进行数字化,随后进行后处理以纠正格式和现代化正字法。SiDiaC 的构建借鉴了其他语料库(如 FarPaHC)的实践,特别是在句法标注和文本规范化策略方面,这得益于低资源语言地位的共同特征。该语料库按体裁分为两个层次:初级层次和次级层次。初级分类是二元的,将每本书分为非虚构和虚构两类,而次级分类更为具体,将文本归入宗教、历史、诗歌、语言和医学等类别。尽管面临获取罕见文献受限和依赖次要日期来源等挑战,SiDiaC 仍是僧伽罗语自然语言处理的基础资源,显著扩展了僧伽罗语的资源,支持词汇变化、新词追踪、历史句法和基于语料库的词典学方面的历时研究。

关键词

引用

@article{arxiv.2509.17912,
  title  = {SiDiaC: Sinhala Diachronic Corpus},
  author = {Nevidu Jayatilleke and Nisansa de Silva},
  journal= {arXiv preprint arXiv:2509.17912},
  year   = {2026}
}

备注

17 pages, 7 figures, 9 tables, Accepted paper at the 39th Pacific Asia Conference on Language, Information and Computation (PACLIC 39)