中文

语言信息化的多语言指令调优:是否存在一组最优语言?

计算与语言 2024-10-11 v1 机器学习

摘要

多语言语言模型由于对某些语言的泛化能力有限,往往在不同语言上的表现不均。这一问题因日益增长的对能够为所有语言工作良好的通用语言模型的兴趣而尤为重要。使用多语言指令-响应对进行指令调优以提高各种语言的模型性能是该问题的一个解决方法。然而,这一方法面临高计算成本、缺乏所有语言质量调优数据,以及“多语言诅咒”——即在添加许多语言后导致性能下降的挑战。最近的研究发现,使用包含少数语言且实例数量较少的数据集可能是有益的。然而,目前尚无系统性地调查如何选择不同语言影响多语言指令调优的研究。我们的研究提出了一种以语言学为导向的方式选择指令调优语言的方法,旨在提升跨语言和跨任务的模型性能。我们使用一种简单算法选择多样化的语言,并在各种基准测试和开放性问题上测试其有效性。我们的结果表明,这种谨慎的选择通常比随机选择语言会产生更好的效果。我们提出了一种新颖且简单的方法,通过基于语言特征选择多样化语言来增强多语言模型,这有助于开发更好的多语言系统并指导数据集创建工作。所有资源,包括语言选择和多语言指令调优的代码,均已在我们的官方存储库 https://github.com/GGLAB-KU/ling-informed-mit 中公开,旨在实现可重复性并进一步推动该领域的研究。

关键词

引用

@article{arxiv.2410.07809,
  title  = {Linguistically-Informed Multilingual Instruction Tuning: Is There an Optimal Set of Languages to Tune?},
  author = {Gürkan Soykan and Gözde Gül Şahin},
  journal= {arXiv preprint arXiv:2410.07809},
  year   = {2024}
}

备注

31 pages, 6 figures