ks-lit-3m:面向大规模语言模型预训练的310万字 Kashmiri 文本数据集
计算与语言
2026-01-06 v1 人工智能
摘要
大型语言模型(LLM)在高资源语言上表现出惊人的流畅性,但始终未能在Kashmiri(约有700万人使用的语言)上生成连贯的文本。这种性能差异并非源于模型固有的局限性,而是源于高质量训练数据的严重匮乏。数十年来Kashmiri文学一直无法被现代NLP管道利用,其编码方式为专有的InPage桌面出版格式。本文介绍了KS-LIT-3M,一套包含310万字(1640万字符)的精选语料库,专为在Kashmiri上预训练语言模型而设计。该数据集结构为单个连续的线性文本流,针对因果语言模型训练进行优化,模型从前文上下文中预测后续标记。通过开发专用的InPage到Unicode转换器,随后进行严格的预处理,包括英文污染移除、字符规范化和质量验证。该语料库涵盖131607个唯一单词,涵盖文学作品、新闻写作、学术文本和宗教学术等多种体裁, KS-LIT-3M解决了Kashmiri语言技术的根本性资源缺口。该数据集采用CC-BY-4.0许可证发布,以促进Kashmiri自然语言处理领域的研究。
引用
@article{arxiv.2601.01091,
title = {ks-lit-3m: A 3.1 million word kashmiri text dataset for large language model pretraining},
author = {Haq Nawaz Malik},
journal= {arXiv preprint arXiv:2601.01091},
year = {2026}
}