中文

面向印度语言的大语言模型预训练数据构建:赫迪语案例研究

统计力学 2025-04-08 v2

摘要

大语言模型(LLMs)在需要基于人类指令自动生成响应的众多应用中展现了变革性能力。然而,为构建LLMs特别是在印度语言领域面临着构建基础LLMs所需高质量数据的主要挑战。本文提出了一个用于印度语言Hindi的大规模预训练数据集。我们收集的数据跨越多个领域,包括主要的赫迪语方言。该数据集包含128亿个Hindi token。我们阐述了包括数据收集、预处理以及LLM预训练可获得性的管道。该方法可以轻松扩展到其他印度语言和低资源语言,供LLM预训练和LLM研究使用。

关键词

引用

@article{arxiv.2407.09856,
  title  = {Corrections to scaling in the 2D phi^4 model: Monte Carlo results and some related problems},
  author = {Jevgenijs Kaupuzs and Roderick Melnik},
  journal= {arXiv preprint arXiv:2407.09856},
  year   = {2025}
}

备注

24 pages, 10 tables, 3 figures