中文

基于公共政府与文化数据的低资源语言指令微调:以哈萨克语为例的案例研究

计算与语言 2026-03-17 v3

摘要

由于文本数据有限,低资源语言的指令微调仍处于探索不足的阶段,尤其是在政府和文化领域。为了解决这一问题,我们引入并开源了一个大规模(10,600 个样本)的指令跟随(IFT)数据集,涵盖与哈萨克斯坦相关的关键制度和文化知识。我们的数据集增强了 LLMs 对程序性、法律性和结构性治理主题的理解。我们采用 LLM 辅助的数据生成方法,比较了开放权重和闭源权重模型在数据集构建中的表现,并选择 GPT-4o 作为骨干模型。我们数据集中的每个实体都经过全面的人工验证以确保高质量。我们还表明,在我们的数据集上对 Qwen、Falcon 和 Gemma 进行微调,可在多项选择和生成任务中带来一致的性能提升,证明了 LLM 辅助指令微调对低资源语言的潜力。

关键词

引用

@article{arxiv.2502.13647,
  title  = {Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in Kazakh},
  author = {Nurkhan Laiyk and Daniil Orel and Rituraj Joshi and Maiya Goloburda and Yuxia Wang and Preslav Nakov and Fajri Koto},
  journal= {arXiv preprint arXiv:2502.13647},
  year   = {2026}
}