中文

通过语言自然且多样化的数据集提升多语言指令微调效果

计算与语言 2024-07-03 v1 人工智能 机器学习

摘要

大语言模型(LLM)的进步显著提升了指令跟随能力。然而,大多数指令微调(IFT)数据集主要使用英文,限制了模型在其他语言中的性能。传统方法,如翻译现有英文 IFT 数据集或通过模板化将现有 NLP 数据集转换为 IFT 数据集,难以捕捉语言细微差别并确保指令(prompt)多样性。为此,我们提出一种新方法,用于收集多语言 IFT 数据集,既保留语言自然性又确保指令多样性。该方法利用以英文为中心的 LLM、单语言语料库以及评分函数,以创建高质量、多样化的多语言 IFT 数据集。实验表明,使用这些 IFT 数据集微调的 LLM 在生成式和判别式任务上均表现出显著提升,表明 LLM 在非英文语境下的语言理解能力得到增强。具体而言,在多语言摘要任务中,使用我们的数据集微调的 LLM 在使用翻译法和模板法微调的 LLM 性能分别提升了 17.57% 和 15.23%。

关键词

引用

@article{arxiv.2407.01853,
  title  = {Improving Multilingual Instruction Finetuning via Linguistically Natural and Diverse Datasets},
  author = {Sathish Reddy Indurthi and Wenxuan Zhou and Shamil Chollampatt and Ravi Agrawal and Kaiqiang Song and Lingxiao Zhao and Chenguang Zhu},
  journal= {arXiv preprint arXiv:2407.01853},
  year   = {2024}
}