斯里兰卡文档数据集:面向法律、新闻与政策的大规模、多语言资源
计算与语言
2026-05-18 v7
摘要
我们 presented了一套开放、机器可读的文档数据集,覆盖斯里兰卡的议会过程、法律判决、政府出版物、新闻和旅游统计。该集合目前包含269,194个文档(79.5 GB),涵盖26个数据集中的 Sinhala、Tamil和English。数据集每日更新,并在GitHub和Hugging Face上镜像。这些资源旨在支持计算语言学、法律分析、社会政治研究和多语言自然语言处理。我们描述了数据来源、收集管道、格式以及潜在用例,同时讨论了许可证和伦理考虑。本手稿版本为v2026-05-15-0811。
引用
@article{arxiv.2510.04124,
title = {Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy},
author = {Nuwan I. Senaratna},
journal= {arXiv preprint arXiv:2510.04124},
year = {2026}
}
备注
4 pages. 269,194 documents (79.5 GB) across 26 datasets in Sinhala, Tamil, and English. Last updated on 2026-05-15