中文

高效语言自适应预训练:扩展面向波兰语的最先进大语言模型

计算与语言 2024-02-16 v1 人工智能

摘要

本研究探讨了微调基础英语大语言模型(LLM)以生成波兰语文本的潜力。第一步是在由 2.76 亿个波兰语 token 组成的高质量数据集(3.11 GB)上进行语言自适应预训练(LAPT)。随后进行额外的微调,旨在解决九个 KLEJ 挑战。我们训练的模型 Curie-7B-v1 不仅在基于解码器的波兰语模型中实现了最低的困惑度(3.02),而且在 9 项任务中的 8 项上,其性能与最佳的波兰语编码器 - 解码器模型非常接近,差距小于 2%。Curie-7B-v1 仅使用了典型数据集大小的约 2-3% 来学习波兰语。LAPT 在消费级 GPU 上不到五天即可完成,突显了该方法的高效性。模型的波兰语能力显著增强,证明了仅训练 1.2% 的参数即可为现有 LLM 添加新语言这一方法的可行性。为促进社区的协同进步,该模型已作为开源项目发布。

关键词

引用

@article{arxiv.2402.09759,
  title  = {Efficient Language Adaptive Pre-training: Extending State-of-the-Art Large Language Models for Polish},
  author = {Szymon Ruciński},
  journal= {arXiv preprint arXiv:2402.09759},
  year   = {2024}
}

备注

10 pages