中文

LLaMA超越英语:语言能力迁移的实证研究

计算与语言 2024-01-15 v2 人工智能

摘要

近年来,大型语言模型取得了显著进展,例如ChatGPT,在一系列复杂任务中展现出卓越的能力。然而,许多主流LLM(如LLaMA)是在英语为主的语料库上预训练的,这限制了它们在非英语语言中的表现。本文聚焦于如何有效地将语言生成和指令跟随能力迁移到非英语语言。为了回答这个问题,我们基于LLaMA进行了广泛的实证研究,累计超过1440 GPU小时。我们分析了词汇扩展、进一步预训练和指令微调等关键因素对迁移的影响。为了准确评估模型的知识水平,我们采用了四个广泛使用的标准化测试基准:C-Eval、MMLU、AGI-Eval和GAOKAO-Bench。此外,基于LLM-Eval(一个包含来自17个不同类别的指令任务的基准),从准确性、流畅性、信息量、逻辑连贯性和无害性等方面对模型的响应质量进行了全面评估。我们的评估结果表明,在知识对齐和响应质量方面,使用不到1%的预训练数据即可达到与最先进的迁移模型相当的性能。此外,在13种低资源语言上的实验结果也显示出类似的趋势。我们期望实验揭示的结论将有助于社区开发非英语LLM。

关键词

引用

@article{arxiv.2401.01055,
  title  = {LLaMA Beyond English: An Empirical Study on Language Capability Transfer},
  author = {Jun Zhao and Zhihao Zhang and Luhui Gao and Qi Zhang and Tao Gui and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2401.01055},
  year   = {2024}
}