Sinhala 历时语料库 v2.0: Sinhala Diachronic Corpus Version 2.0
计算与语言
2026-03-12 v1
摘要
SiDiaC-v.2.0 是目前为止最大完整的 Sinhala 历时语料库,涵盖以出版日期计的 1800 年至 1955 年,以及以书写日期计的 5 世纪至 20 世纪的历史时段。该语料库包含 244k 单词,涵盖 185 部文学作品,经过彻底的过滤、预处理和版权合规性检查,并进行了广泛的后处理。此外,针对其中 59 份文档(总计 70k 单词)基于书写日期进行了注释。选自斯里兰卡国家图书馆的文本,来自 SiDiaC-v.1.0 未过滤列表,使用 Google Document AI OCR 进行数字化处理。随后进行后处理,以纠正格式问题、解决代码混合问题、包含特殊标记并修复格式错误的标记。SiDiaC-v.2.0 的构建参考了其他语料库的实践,如 FarPaHC、SiDiaC-v.1.0 和 CCOHA。特别是针对 Faroese 与类似清洗策略在 CCOHA 中所见的低资源语言状态,SiDiaC-v.2.0 针对句法注释和文本规范化策略进行了借鉴。该语料库按体裁分为两层:主要层次和次要层次。主要层次为二元分类,将每本书分为非小说或小说。次要层次更为细致,将文本归类为宗教、历史、诗歌、语言和医学等具体体裁。尽管面临资源有限的挑战,SiDiaC-v.2.0 作为 Sinhala NLP 的综合资源,建立在 SiDiaC-v.1.0 之前工作基础之上。
关键词
引用
@article{arxiv.2603.10861,
title = {SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0},
author = {Nevidu Jayatilleke and Nisansa de Silva and Uthpala Nimanthi and Gagani Kulathilaka and Azra Safrullah and Johan Sofalas},
journal= {arXiv preprint arXiv:2603.10861},
year = {2026}
}
备注
23 pages, 13 figures, 10 tables, Accepted paper at the 15th Language Resources and Evaluation Conference (LREC 2026)