中文

LuxIT:来自单语种种子数据的卢森堡语指令调优数据集

计算与语言 2026-03-31 v2

摘要

指令调优型大语言模型(Large Language Models, LLMs)的效果往往在资源匮乏的语言环境中受到限制,原因在于缺乏高质量的训练数据。我们引入LuxIT,一个新型的、针对卢森堡语的单语种指令调优数据集,以缓解这一挑战。我们利用来自本土卢森堡语文本的语料库,采用DeepSeek-R1-0528进行数据合成,该模型因在卢森堡语方面的表现而被选择。在生成后,我们应用了质量保证流程,采用LLM作为评判器(LLM-as-a-judge)的方法,最终保留下227,507对高质量的指令-答案对。为调查该数据集的实际效用,我们在LuxIT上对14个规模较小的LLMs(参数数\leq15B)进行微调,并在标准化的卢森堡语熟练程度考试以及五个下游NLP任务上进行评估。在所有14个模型上的语言考试中,基于LuxIT的训练使平均准确率提升5.37个百分点,其中12个模型表现出改善。在NLP下游任务中,9个模型在宏平均F1分数上得到改善,但两个基准测试上的提升并不系统地相关。这些结果凸显了利用单语种合成数据提升低资源语言中LLM能力的可行性,同时也揭示了语言熟练程度的多方面性。

关键词

引用

@article{arxiv.2510.24434,
  title  = {LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data},
  author = {Julian Valline and Cedric Lothritz and Siwen Guo and Jordi Cabot},
  journal= {arXiv preprint arXiv:2510.24434},
  year   = {2026}
}