Pula:为 Setswana 训练大型语言模型
计算与语言
2025-04-29 v2
摘要
本工作提出 Pula,一套能够熟练掌握 Setswana 和 English 双语的大型语言模型。Pula 8B 和 Pula 14B 在 English-Setswana 翻译任务中超越 GPT-4o 和 Gemini 1.5 Pro,并在自 Setswana 为主的推理任务中实现了其规模对应的最佳性能。我们发布了 Pula 1B、3B、8B 和 14B 以及训练日志、训练与评估代码。随同 Pula,我们发布了最大的 Setswana 文本语料库 Marothodi,以及第一个全面的 Setswana 指令调优数据集 Medupi,包含重新格式化的数据集、翻译语料和合成 LLM 生成文本。为配合此数据,我们发布了用于数据集构建、格式化、过滤和爬虫的工具代码。最后,我们发布两个 Setswana LLM 翻译基准 MMLU-tsn 和 GSM8K-tsn,用于衡量 Setswana 知识和推理能力。
关键词
引用
@article{arxiv.2408.02239,
title = {Pula: Training Large Language Models for Setswana},
author = {Nathan Brown and Vukosi Marivate},
journal= {arXiv preprint arXiv:2408.02239},
year = {2025}
}
备注
NAACL 2025. 10 pages, 5 tables, 1 figure