SinLlama——面向斯林好语的大型语言模型
计算与语言
2025-11-11 v4
摘要
诸如斯林好语(Sinhala)这样的低资源语言常被忽视。本研究扩展了现有的多语言大型语言模型(Llama-3-8B),以更好地服务于斯林好语。我们增强了 LLM 的词汇化模块,加入斯林好语特定词汇,并在清洗后的 1000 万斯林好语语料上进行持续预训练,得到 SinLlama 模型。这是一个具有显式斯林好语支持的首个解码器架构开源大型语言模型。当 SinLlama 在三个文本分类任务上进行指令微调时,相较于 Llama-3-8B 的基础版本和指令版本,表现显著优于后者。
引用
@article{arxiv.2508.09115,
title = {SinLlama -- A Large Language Model for Sinhala},
author = {H. W. K. Aravinda and Rashad Sirajudeen and Samith Karunathilake and Nisansa de Silva and Surangika Ranathunga and Rishemjit Kaur},
journal= {arXiv preprint arXiv:2508.09115},
year = {2025}
}